Отключение OpenAI Assistants API 26 августа: что сломается и как мигрировать
26 августа 2026 OpenAI отключает /v1/assistants, /v1/threads и /v1/runs. Что упадёт, почему это не замена endpoint'ов и как за 1-2 недели переехать на Responses API.
Dali
Dali - студия AI agent systems. Давид ведёт engineering и продукт, Лиана - operations и fit процессов. Делаем production-агентов в tools, которыми команда уже пользуется.
David Hakobyan · Dali
Прямой ответ
26 августа 2026 OpenAI отключает Assistants API: /v1/assistants, /v1/threads и /v1/runs. После этой даты запросы возвращают ошибки. Приложения на этих endpoint'ах не деградируют - они просто перестают отвечать. Замена - Responses API, и миграция - это настоящая инженерная работа, а не смена URL. Реалистичный объём для production-бота: 1-2 недели.
Что именно произойдёт 26 августа
- Каждый вызов
/v1/assistants,/v1/threadsи/v1/runsначинает возвращать ошибки. - Нет ни read-only, ни деградированного режима. Бот, который создаёт thread на каждый разговор, падает на первом же сообщении.
- OpenAI анонсировал deprecation с миграцией на Responses API. Официальный migration-док: developers.openai.com/api/docs/assistants/migration.
- Azure OpenAI Assistants уходит в том же окне, так что затронутая аудитория удваивается: команды на Azure не исключение.
Почему это не замена endpoint'ов
У Responses API другая форма, а не просто другой URL:
- Threads и состояние run'ов раньше хранил OpenAI на своей стороне. В Responses API состояние разговора - забота вашего приложения: хранить историю, решать, что попадает в каждый запрос, обрезать контекст.
- Меняется модель стоимости. Вы платите за контекст, который пересылаете, поэтому наивный порт «переигрывать весь thread на каждом ходе» быстро становится дорогим.
- У части фич Assistants нет прямого аналога - эти пути нужно перепроектировать, а не переводить.
- Production-приложения, которые создают assistants динамически (на каждого тенанта, клиента, workflow), чистого эквивалента не имеют. Эту архитектуру придётся переосмыслить.
Что сломается на практике
Типичные жертвы - системы, собранные в 2023-2025 на тогдашнем рекомендованном стеке:
- Support-боты с thread'ами на каждого пользователя
- Intake- и квалификационные боты на сайтах
- Внутренние ассистенты по документам и инструментам компании
Каждый активный разговор упадёт в первый же день. Пользователи видят мёртвый виджет, саппорт видит всплеск обращений, и никто заранее не видит предупреждающего баннера.
Чеклист миграции
- Замапить все вызовы. Инвентаризация каждого места, где код трогает
/v1/assistants,/v1/threads,/v1/runs, и от каких фич он зависит (file search, code interpreter, function calls, per-tenant assistants). - Портировать на Responses API. Перенести управление состоянием в приложение, пересобрать tool-обвязку, выбрать стратегию контекста, при которой стоимость остаётся вменяемой.
- Прогнать evals бок о бок. Одни и те же входы через старый и новый путь, сравнить выходы до любого переключения. Связанное: как оценивать агентов до go-live.
- Zero-downtime cutover. Направить часть трафика на новый путь, понаблюдать, затем переключиться полностью с готовым rollback'ом.
Реалистичный объём для production-бота: 1-2 недели. Меньше, если бот тонкий; больше, если вы строили per-tenant assistants.
Что сделать до 26 августа даже без нас
- Заморозьте изменения на flow, которые трогают Assistants API. Каждая новая фича на старом стеке - это долг миграции.
- Выгрузите данные thread'ов сейчас. История thread'ов после отключения невосстановима. Если разговоры важны для бизнеса (контекст саппорта, история продаж, compliance) - забирайте их, пока endpoint'ы ещё отвечают.
Как Dali это ведёт
Dali мигрирует нагрузки с Assistants API на Responses API за 1-2 недели, фиксированная цена от $1,900: маппинг вызовов, порт, eval-прогоны до/после и zero-downtime cutover. Гарантия: если приёмочный тест не проходит - вы не платите. Начните с аудита: solutions. Связанное: production AI-агенты, фреймворки и hosted assistants.
FAQ
Да, если он вызывает `/v1/assistants`, `/v1/threads` или `/v1/runs`. После 26 августа 2026 эти запросы возвращают ошибки, поэтому падает каждый разговор. Это отключение, а не замедление.