Коротко
Если смотреть только на тесты по коду, счёт между GPT-6 Astra и Claude Fable 5.1 примерно равный. Astra впереди на терминальных задачах и на DeepSWE, на FrontierCode модели идут вровень, а в сводном индексе агентного кодинга лидирует Fable 5.1.
Для практика это означает простую вещь: качество кода перестало быть главным критерием выбора между флагманами. Решают инструменты вокруг модели, стоимость длинной сессии и то, как модель ведёт себя на ваших репозиториях.
Цифры по коду
В таблице — опубликованные результаты обеих моделей. Для масштаба добавлен Opus 5: он вдвое дешевле обеих и на части тестов почти не отстаёт.
| Бенчмарк | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,7% | 55,8% | 52,3% |
| DeepSWE v1.1 | 74,1% | 69,9% | нет данных |
| FrontierCode 1.1 | 53,3% | 53,5% | 53,4% |
| Индекс агентного кодинга | 67 | 70 | нет данных |
| ScreenSpot-Pro | 92,7% | 87,3% | нет данных |
Терминал и автономные агенты
Terminal-Bench проверяет, может ли модель довести задачу до конца в настоящем терминале: поставить зависимости, собрать проект, найти и исправить ошибку, убедиться, что тесты проходят. У Astra 57,7%, у Fable 5.1 — 55,8%. Разница в два пункта реальна, но невелика: на ста задачах это две дополнительно решённые.
DeepSWE — более заметный отрыв Astra: 74,1% против 69,9%. OpenAI отдельно подчёркивает, что лучшая конфигурация Astra решает эти задачи примерно на 57% дешевле предыдущей модели GPT-5.6 Sol. Обратите внимание: это сравнение с собственной предшественницей, а не с Claude.
В сводном индексе агентного кодинга, который усредняет несколько независимых наборов, впереди Fable 5.1: 70 против 67. Так бывает, когда одна модель сильнее на отдельных тестах, а другая ровнее на всём наборе.
- Терминальные задачи: Astra впереди на два пункта.
- DeepSWE: Astra впереди на четыре пункта.
- Сводный индекс агентного кодинга: Fable 5.1 впереди на три пункта.
Сложный код: паритет
FrontierCode — набор самых тяжёлых задач на программирование. Результаты: Astra 53,3%, Fable 5.1 53,5%, Opus 5 53,4%. Три модели от двух компаний уместились в две десятых процента.
Вывод отсюда неприятен для маркетинга обеих компаний и полезен для вашего бюджета: на действительно сложном коде флагманы упёрлись в один потолок, и Opus 5 за половину цены упирается в него же. Если ваша работа — писать и править код, а не гонять суточные автономные прогоны, переплата за флагман любой из компаний может не окупиться.
Управление компьютером
Это дисциплина, где Astra выигрывает без оговорок. 92,7% против 87,3% на ScreenSpot-Pro, 72,6% на OSWorld 2.0 и почти вдвое меньшее время на задачу, чем у предыдущего поколения OpenAI. Для автотестов через интерфейс, для агентов, работающих с программами без API, для автоматизации рутины в браузере — это серьёзное преимущество.
Интересная деталь из замеров безопасности: в сценариях управления компьютером Astra допускает нежелательные действия в 2,4% случаев, Fable 5.1 — в 9,5%. Если агент получает доступ к реальной машине с реальными данными, эта цифра важнее процента на бенчмарке.
Обратная сторона: защитные проверки Astra в API не спрашивают подтверждения, а останавливают задачу целиком. Для ночного автономного прогона это означает, что утром вы можете найти остановленную на полпути работу.
- Точность работы с интерфейсами: Astra 92,7%, Fable 5.1 87,3%.
- Нежелательные действия агента: Astra 2,4%, Fable 5.1 9,5%.
- Проверки безопасности Astra могут остановить задачу в API без запроса.
Codex против Claude Code
Модель редко используют голой — обычно она работает внутри агентной обвязки. У OpenAI это Codex, у Anthropic — Claude Code. Обе обвязки зрелые: терминал, работа с репозиторием, запуск тестов, подагенты.
В Codex вместе с Astra появились экспериментальные заметки по контексту с поиском — способ переносить знания между окнами контекста. В Claude Code упор сделан на другое: навыки, хуки, подключение внешних инструментов по MCP, параллельные подагенты и фоновые задачи.
Практический критерий выбора здесь скучный, но честный: в какой обвязке уже живёт ваша команда. Перенос настроек, инструкций проекта, привычек и интеграций с одной платформы на другую стоит дороже, чем два пункта на любом бенчмарке.
Сколько стоит агентная сессия
Ценник за токен у моделей одинаковый, но агент, который пишет код, — это десятки шагов с большим стабильным контекстом: системная инструкция, описания инструментов, прочитанные файлы, история. Весь этот объём на каждом шаге читается из кеша.
Чтение кеша у Astra стоит 1 доллар за миллион токенов, у Fable 5.1 — 0,25. Сессия на 50 шагов с префиксом в 120 тысяч токенов — это 6 миллионов прочитанных из кеша токенов: около 6 долларов на Astra и около полутора на Fable 5.1.
Второй нюанс — порог длинного контекста. У Astra запрос с входом больше 272 тысяч токенов переоценивается целиком: вход и кеш вдвое дороже, выход в полтора раза. Работа с большим монорепозиторием пересекает этот порог легко. У Fable 5.1 прайс единый на всё окно.
Справедливости ради: по данным OpenAI, Astra тратит на задачах по коду примерно втрое меньше исходящих токенов, чем GPT-5.6 Sol. Прямого сравнения расхода токенов с Fable 5.1 никто не публиковал, поэтому итоговую стоимость задачи можно узнать только замером.
- Чтение кеша: 1,00 против 0,25 доллара за миллион.
- У Astra свыше 272K входящих токенов запрос дорожает целиком.
- Расход токенов на задачу у моделей разный — нужен собственный замер.
Как выбирать
Агент кликает по интерфейсам или вы строите автоматизацию рабочего стола — берите Astra. Длинные сессии в большом репозитории, команда уже работает в Claude Code, важна предсказуемая стоимость — берите Fable 5.1, а для повседневных задач оставьте Opus 5 или Sonnet 5.
И не забывайте про третий вариант, который показывает FrontierCode: возможно, вам не нужен флагман вообще. Большая часть повседневной разработки решается на Opus 5 и Sonnet 5 с первого раза, и двукратная переплата за токен там ничего не покупает.
Через наш шлюз доступны все модели Claude, включая Fable 5.1, и Claude Code настраивается сменой базового URL. GPT-6 Astra у нас нет — мы работаем только с моделями Anthropic.
- Интерфейсы и автоматизация рабочего стола — GPT-6 Astra.
- Длинные сессии в репозитории и Claude Code — Fable 5.1.
- Повседневная разработка — Opus 5 или Sonnet 5.