Почему это сравнение важнее, чем кажется
GPT-6 Astra принято сравнивать с Claude Fable 5.1 — у них одинаковый ценник и одинаковое позиционирование. Но большинство команд работает не на Fable, а на Opus 5: он стоит 5 и 25 долларов за миллион токенов и закрывает подавляющую часть задач.
Поэтому практический вопрос звучит иначе: если я сейчас на Opus 5, даст ли мне Astra что-то такое, ради чего стоит платить вдвое больше и переезжать на другую платформу?
| Параметр | GPT-6 Astra | Claude Opus 5 |
|---|---|---|
| Идентификатор | gpt-6-astra | claude-opus-5 |
| Вход $/1M | 10 | 5 |
| Выход $/1M | 50 | 25 |
| Чтение кеша $/1M | 1,00 | 0,50 |
| Контекст | 1M | 1M |
| Ускоренный режим | Есть | Есть |
| Принудительный вызов инструмента | Есть | Есть |
Бенчмарки
По Opus 5 опубликовано больше общих с Astra тестов, чем по Fable 5.1, поэтому картина получается полнее. И она очень неоднородная: от разрыва в 24 пункта до разницы в десятую долю процента.
| Бенчмарк | GPT-6 Astra | Claude Opus 5 | Разница |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 97,6% | 73,2% | +24,4 у Astra |
| ExploitBench | 100% | 70,0% | +30 у Astra |
| Terminal-Bench 4.0 | 57,7% | 52,3% | +5,4 у Astra |
| Agents' Last Exam | 59,3% | 55,5% | +3,8 у Astra |
| OSWorld 2.0 | 72,6% | 70,2% | +2,4 у Astra |
| GPQA Diamond | 96,0% | 93,7% | +2,3 у Astra |
| FrontierCode 1.1 | 53,3% | 53,4% | Паритет |
| Humanity's Last Exam с инструментами | 57,2% | 63,6% | +6,4 у Opus 5 |
Где двойная цена окупается
Математика исследовательского уровня: 97,6% против 73,2%. Если ваши задачи — доказательства, сложные вычисления, научные расчёты, то это не косметическая разница, а другой класс результата.
Терминальные агентные задачи: плюс пять пунктов на Terminal-Bench. Для автономных прогонов, где каждая нерешённая задача — это ручная работа инженера, пять пунктов могут окупить удвоение счёта.
Безопасность агента на реальной машине: в сценариях управления компьютером Astra допускает нежелательные действия в 2,4% случаев, Opus 5 — в 11,5%. В задачах, приближённых к реальной работе, доля нежелательных исходов — 3,4% против 13,5%. Если агент работает с боевыми данными без присмотра, это сильный аргумент.
Отдельно про кибербезопасность: 100% на ExploitBench выглядит эффектно, но создание эксплойтов у Astra закрыто программой Daybreak с отдельным доступом. Обычному клиенту API эта возможность недоступна.
- Исследовательская математика — разрыв в 24 пункта.
- Автономные терминальные задачи — плюс 5 пунктов.
- Нежелательные действия агента — в несколько раз реже.
Где Opus 5 достаточно
Сложный код: 53,3% против 53,4% на FrontierCode. За половину цены Opus 5 выдаёт тот же результат. Если ваша основная нагрузка — написание и правка кода, переплата не покупает ничего.
Общее рассуждение с инструментами: на Humanity's Last Exam Opus 5 впереди на 6,4 пункта. Более дешёвая модель здесь попросту лучше.
Управление компьютером на OSWorld: 72,6% против 70,2%. Разница есть, но 2,4 пункта за двойную цену — сделка на любителя. Astra при этом проходит задачи заметно быстрее, и если время прогона для вас деньги, считайте отдельно.
Про ARC-AGI-3, где у Astra заявлено 99,9% против 30,2% у Opus 5: цифра Astra получена в специальной обвязке с сохранением состояния, прогон в которой стоит десятки тысяч долларов. В стандартной обвязке независимые замеры дают Astra от 17 до 63%. Сравнивать 99,9 и 30,2 напрямую некорректно.
- Сложный код — паритет за половину цены.
- Общее рассуждение — Opus 5 впереди.
- OSWorld — разница 2,4 пункта.
Счёт: вдвое — это минимум
По всем строкам прайса Astra ровно вдвое дороже Opus 5: вход, выход, чтение кеша. Но есть строка, которой у Opus 5 нет, — порог длинного контекста. Запрос Astra с входом больше 272 тысяч токенов переоценивается целиком: вход и кеш ещё вдвое, выход в полтора раза.
Итог для работы с большими контекстами: Astra обходится вчетверо дороже Opus 5 по входу и кешу и втрое — по выходу. Команда, которая тратит на Opus 5 условные 100 тысяч рублей в месяц на длинных сессиях, после переезда получит счёт не на 200, а ближе к 300–400.
Цена переезда, которой нет в прайсе
Смена платформы — это не замена одной строки. Другой формат API, другие правила кеширования, другой токенизатор, другое поведение на тех же промптах. Системные инструкции, которые вы месяцами шлифовали под Claude, придётся шлифовать заново.
Если вы работаете в Claude Code — с навыками, хуками, подключёнными по MCP инструментами, — всё это остаётся на стороне Anthropic. У OpenAI есть Codex, но это другая экосистема с другими соглашениями.
Разумная стратегия: не переезжать, а добавить. Оставить основную нагрузку на Opus 5, а под конкретную задачу, где Astra выигрывает кратно, завести отдельный маршрут. Если внутри экосистемы Claude нужен класс выше — для этого есть Fable 5.1 с тем же API.
- Промпты и агентную логику придётся настраивать заново.
- Экосистема Claude Code не переносится.
- Отдельный маршрут под задачу лучше полного переезда.
Итог
GPT-6 Astra стоит двойной цены в трёх случаях: тяжёлая математика, автономные терминальные агенты и агенты с доступом к реальной машине, где важна низкая доля нежелательных действий. Во всех остальных сценариях Opus 5 даёт сопоставимый или лучший результат за половину денег.
Opus 5, как и остальные модели Claude, доступен через наш шлюз с оплатой в рублях. GPT-6 Astra у нас нет: мы работаем только с моделями Anthropic и предпочитаем сказать об этом прямо.