← Назад в блог

18 августа 2026 г.11 мин • AI Architecture Team

Claude Opus 5: обзор модели — что нового по сравнению с Opus 4.8 и как её настраивать

Разбор Claude Opus 5: мышление включено по умолчанию, пять уровней усилия, fast mode, бюджеты задач, системные сообщения в середине диалога. Что удалили из API и какие ошибки ловят при переходе.

Коротко: что это за модель

Claude Opus 5 — старшая модель повседневного класса в поколении Claude 5. Идентификатор claude-opus-5, окно контекста 1 миллион токенов, до 128 тысяч токенов на выход, цена 5 долларов за миллион входящих и 25 за миллион исходящих по официальному прайсу Anthropic.

По позиционированию она занимает то же место, что раньше занимала Opus 4.8: архитектурные решения, разбор незнакомого репозитория, длинные агентные цепочки, сложная отладка. Цена за токен та же самая, что у 4.8 и 4.7 — переход на пятёрку не удорожает запрос сам по себе.

А вот поведение по умолчанию изменилось, и это главное, что нужно знать перед переносом кода.

ПараметрЗначение
Идентификаторclaude-opus-5
Контекст1 000 000 токенов
Максимум на выход128 000 токенов
Цена входа5 USD за 1M токенов
Цена выхода25 USD за 1M токенов
Уровни усилияlow, medium, high, xhigh, max

Новинка первая: мышление включено по умолчанию

На Opus 4.8 и 4.7 отсутствие параметра thinking означало, что модель отвечает без рассуждения. На Opus 5 всё наоборот: если параметр не передан, включается адаптивное мышление. Явная запись thinking со значением adaptive даёт ровно тот же результат.

Практическое следствие: код, который просто не передавал thinking и получал дешёвые быстрые ответы на 4.8, после смены идентификатора модели начнёт думать — и счёт вырастет. Это не баг, а смена умолчания, но заметить её по логам сложно.

Отключить мышление можно, но только на усилии high и ниже. Комбинация отключённого мышления с усилием xhigh или max возвращает ошибку 400.

  • Не передали thinking — модель всё равно думает.
  • Явное отключение работает только при усилии high и ниже.
  • Вместо отключения обычно правильнее опустить усилие до low или medium.

Подводный камень отключённого мышления

Если вы всё-таки отключаете мышление, знайте про два неприятных эффекта. Первый: модель иногда пишет вызов инструмента обычным текстом ответа вместо структурного блока вызова. Запрос завершается успешно, ошибки нет, но инструмент не вызывается — а в агентном цикле этот текст потом отравляет следующие шаги.

Второй: в ответ могут просочиться служебные XML-теги рассуждения. Оба эффекта лечатся включением мышления с низким усилием — и это выходит дешевле, чем отлаживать молчаливо несработавшие вызовы.

Если по какой-то причине маршрут обязан работать без мышления, уберите из промпта любые запреты вида «не рассуждай» — они делают протечку тегов сильнее, а не слабее.

  • Вызов инструмента текстом — самый дорогой из тихих сбоев в агентах.
  • Инструкции «не думай» ухудшают ситуацию.
  • Мышление на низком усилии дешевле и надёжнее полного отключения.

Новинка вторая: fast mode

Fast mode — исследовательский режим, доступный только на Opus 5 и Opus 4.8. Та же самая модель отдаёт до двух с половиной раз больше исходящих токенов в секунду, но по премиальной цене: 10 долларов за миллион входящих и 50 за миллион исходящих.

Включается тремя вещами одновременно: обращением к бета-версии эндпоинта сообщений, бета-флагом fast-mode-2026-02-01 и параметром speed со значением fast на верхнем уровне запроса. Не заголовком и не внутри дополнительных полей — именно параметром тела.

У режима отдельный лимит запросов. При отказе по лимиту разумная стратегия — повторить с задержкой либо убрать speed и уйти на обычную скорость, помня, что смена скорости обнуляет кеш промпта. С пакетным API и приоритетным тарифом fast mode не сочетается.

  • Только Opus 5 и Opus 4.8, только прямой API.
  • Цена ровно вдвое выше обычной.
  • Отдельный лимит и несовместимость с пакетной обработкой.

Новинка третья: бюджет задачи и системные сообщения по ходу диалога

Бюджет задачи — это потолок в токенах, о котором модель знает и под который сама распределяет силы, чтобы закончить работу аккуратно, а не оборваться на середине. Это принципиально другое, чем max_tokens: max_tokens просто режет вывод, и модель об этом ограничении не подозревает.

Задаётся внутри output_config полем task_budget с бета-флагом task-budgets-2026-03-13, минимум 20 тысяч токенов. Запрос стоит делать потоковым — при больших значениях max_tokens обычный запрос упирается в таймаут HTTP.

Вторая полезная мелочь: на Opus 5 можно добавить сообщение с ролью system прямо в массив сообщений, а не править верхнеуровневый системный промпт. Смысл — не сломать кеш: правка верхнего системного промпта обнуляет весь кешированный префикс, а сообщение в середине диалога его сохраняет.

  • task_budget — советующий потолок, max_tokens — жёсткий обрез.
  • Минимальный бюджет задачи — 20 000 токенов.
  • Системное сообщение в массиве messages сохраняет кеш, правка system — нет.
  • На Sonnet 5 системные сообщения в середине диалога не поддерживаются.

Что из API убрали

Три вещи, которые работали на старых моделях и теперь возвращают ошибку 400. Первая — budget_tokens: фиксированный бюджет на размышление заменён адаптивным мышлением и уровнем усилия. Вторая — параметры сэмплирования temperature, top_p и top_k. Третья — префилл ответа ассистента: заранее заданное начало ответа больше не принимается.

Если формат ответа раньше держался на префилле, замените его структурированным выводом через output_config.format или инструкцией в системном промпте. Параметр output_format устарел, используется вложенный output_config.

БылоСталоЧто будет, если оставить
thinking с budget_tokensthinking типа adaptive и effortОшибка 400
temperature / top_p / top_kНе поддерживаютсяОшибка 400
Префилл ответа ассистентаoutput_config.formatОшибка 400
output_formatoutput_config.formatУстаревший параметр

Как вызвать Opus 5 через шлюз из России

Идентификатор модели через наш шлюз тот же самый — claude-opus-5. Меняются только адрес подключения и токен, всё остальное в коде остаётся как в официальной документации Anthropic: формат запроса, названия параметров, структура ответа.

Никаких дат к идентификатору дописывать не нужно. Строки моделей поколения Claude 5 самодостаточны, а привычка добавлять суффикс с датой осталась от старых поколений и приводит к ошибке «модель не найдена».

  • В коде меняются две переменные окружения, идентификатор модели — нет.
  • Суффиксы с датой в идентификаторах Claude 5 не используются.
  • Расход по каждой модели виден отдельной строкой в личном кабинете.

Что дальше

Если планируете внедрять Claude API в продакшн, начните с понятной структуры тарифа и сразу настройте контроль расхода токенов в личном кабинете.