Коротко: что это за модель
Claude Opus 5 — старшая модель повседневного класса в поколении Claude 5. Идентификатор claude-opus-5, окно контекста 1 миллион токенов, до 128 тысяч токенов на выход, цена 5 долларов за миллион входящих и 25 за миллион исходящих по официальному прайсу Anthropic.
По позиционированию она занимает то же место, что раньше занимала Opus 4.8: архитектурные решения, разбор незнакомого репозитория, длинные агентные цепочки, сложная отладка. Цена за токен та же самая, что у 4.8 и 4.7 — переход на пятёрку не удорожает запрос сам по себе.
А вот поведение по умолчанию изменилось, и это главное, что нужно знать перед переносом кода.
| Параметр | Значение |
|---|---|
| Идентификатор | claude-opus-5 |
| Контекст | 1 000 000 токенов |
| Максимум на выход | 128 000 токенов |
| Цена входа | 5 USD за 1M токенов |
| Цена выхода | 25 USD за 1M токенов |
| Уровни усилия | low, medium, high, xhigh, max |
Новинка первая: мышление включено по умолчанию
На Opus 4.8 и 4.7 отсутствие параметра thinking означало, что модель отвечает без рассуждения. На Opus 5 всё наоборот: если параметр не передан, включается адаптивное мышление. Явная запись thinking со значением adaptive даёт ровно тот же результат.
Практическое следствие: код, который просто не передавал thinking и получал дешёвые быстрые ответы на 4.8, после смены идентификатора модели начнёт думать — и счёт вырастет. Это не баг, а смена умолчания, но заметить её по логам сложно.
Отключить мышление можно, но только на усилии high и ниже. Комбинация отключённого мышления с усилием xhigh или max возвращает ошибку 400.
- Не передали thinking — модель всё равно думает.
- Явное отключение работает только при усилии high и ниже.
- Вместо отключения обычно правильнее опустить усилие до low или medium.
Подводный камень отключённого мышления
Если вы всё-таки отключаете мышление, знайте про два неприятных эффекта. Первый: модель иногда пишет вызов инструмента обычным текстом ответа вместо структурного блока вызова. Запрос завершается успешно, ошибки нет, но инструмент не вызывается — а в агентном цикле этот текст потом отравляет следующие шаги.
Второй: в ответ могут просочиться служебные XML-теги рассуждения. Оба эффекта лечатся включением мышления с низким усилием — и это выходит дешевле, чем отлаживать молчаливо несработавшие вызовы.
Если по какой-то причине маршрут обязан работать без мышления, уберите из промпта любые запреты вида «не рассуждай» — они делают протечку тегов сильнее, а не слабее.
- Вызов инструмента текстом — самый дорогой из тихих сбоев в агентах.
- Инструкции «не думай» ухудшают ситуацию.
- Мышление на низком усилии дешевле и надёжнее полного отключения.
Новинка вторая: fast mode
Fast mode — исследовательский режим, доступный только на Opus 5 и Opus 4.8. Та же самая модель отдаёт до двух с половиной раз больше исходящих токенов в секунду, но по премиальной цене: 10 долларов за миллион входящих и 50 за миллион исходящих.
Включается тремя вещами одновременно: обращением к бета-версии эндпоинта сообщений, бета-флагом fast-mode-2026-02-01 и параметром speed со значением fast на верхнем уровне запроса. Не заголовком и не внутри дополнительных полей — именно параметром тела.
У режима отдельный лимит запросов. При отказе по лимиту разумная стратегия — повторить с задержкой либо убрать speed и уйти на обычную скорость, помня, что смена скорости обнуляет кеш промпта. С пакетным API и приоритетным тарифом fast mode не сочетается.
- Только Opus 5 и Opus 4.8, только прямой API.
- Цена ровно вдвое выше обычной.
- Отдельный лимит и несовместимость с пакетной обработкой.
Новинка третья: бюджет задачи и системные сообщения по ходу диалога
Бюджет задачи — это потолок в токенах, о котором модель знает и под который сама распределяет силы, чтобы закончить работу аккуратно, а не оборваться на середине. Это принципиально другое, чем max_tokens: max_tokens просто режет вывод, и модель об этом ограничении не подозревает.
Задаётся внутри output_config полем task_budget с бета-флагом task-budgets-2026-03-13, минимум 20 тысяч токенов. Запрос стоит делать потоковым — при больших значениях max_tokens обычный запрос упирается в таймаут HTTP.
Вторая полезная мелочь: на Opus 5 можно добавить сообщение с ролью system прямо в массив сообщений, а не править верхнеуровневый системный промпт. Смысл — не сломать кеш: правка верхнего системного промпта обнуляет весь кешированный префикс, а сообщение в середине диалога его сохраняет.
- task_budget — советующий потолок, max_tokens — жёсткий обрез.
- Минимальный бюджет задачи — 20 000 токенов.
- Системное сообщение в массиве messages сохраняет кеш, правка system — нет.
- На Sonnet 5 системные сообщения в середине диалога не поддерживаются.
Что из API убрали
Три вещи, которые работали на старых моделях и теперь возвращают ошибку 400. Первая — budget_tokens: фиксированный бюджет на размышление заменён адаптивным мышлением и уровнем усилия. Вторая — параметры сэмплирования temperature, top_p и top_k. Третья — префилл ответа ассистента: заранее заданное начало ответа больше не принимается.
Если формат ответа раньше держался на префилле, замените его структурированным выводом через output_config.format или инструкцией в системном промпте. Параметр output_format устарел, используется вложенный output_config.
| Было | Стало | Что будет, если оставить |
|---|---|---|
| thinking с budget_tokens | thinking типа adaptive и effort | Ошибка 400 |
| temperature / top_p / top_k | Не поддерживаются | Ошибка 400 |
| Префилл ответа ассистента | output_config.format | Ошибка 400 |
| output_format | output_config.format | Устаревший параметр |
Как вызвать Opus 5 через шлюз из России
Идентификатор модели через наш шлюз тот же самый — claude-opus-5. Меняются только адрес подключения и токен, всё остальное в коде остаётся как в официальной документации Anthropic: формат запроса, названия параметров, структура ответа.
Никаких дат к идентификатору дописывать не нужно. Строки моделей поколения Claude 5 самодостаточны, а привычка добавлять суффикс с датой осталась от старых поколений и приводит к ошибке «модель не найдена».
- В коде меняются две переменные окружения, идентификатор модели — нет.
- Суффиксы с датой в идентификаторах Claude 5 не используются.
- Расход по каждой модели виден отдельной строкой в личном кабинете.