← Назад в блог

20 сентября 2026 г.10 мин • AI Architecture Team

GPT-6 Astra или Claude Fable 5.1 для программирования: что лучше пишет код и ведёт агентов

Сравнение GPT-6 Astra и Claude Fable 5.1 в задачах разработки: Terminal-Bench, DeepSWE, FrontierCode, индекс агентного кодинга, управление компьютером, Codex против Claude Code и стоимость агентной сессии.

Коротко

Если смотреть только на тесты по коду, счёт между GPT-6 Astra и Claude Fable 5.1 примерно равный. Astra впереди на терминальных задачах и на DeepSWE, на FrontierCode модели идут вровень, а в сводном индексе агентного кодинга лидирует Fable 5.1.

Для практика это означает простую вещь: качество кода перестало быть главным критерием выбора между флагманами. Решают инструменты вокруг модели, стоимость длинной сессии и то, как модель ведёт себя на ваших репозиториях.

Цифры по коду

В таблице — опубликованные результаты обеих моделей. Для масштаба добавлен Opus 5: он вдвое дешевле обеих и на части тестов почти не отстаёт.

БенчмаркGPT-6 AstraClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.057,7%55,8%52,3%
DeepSWE v1.174,1%69,9%нет данных
FrontierCode 1.153,3%53,5%53,4%
Индекс агентного кодинга6770нет данных
ScreenSpot-Pro92,7%87,3%нет данных

Терминал и автономные агенты

Terminal-Bench проверяет, может ли модель довести задачу до конца в настоящем терминале: поставить зависимости, собрать проект, найти и исправить ошибку, убедиться, что тесты проходят. У Astra 57,7%, у Fable 5.1 — 55,8%. Разница в два пункта реальна, но невелика: на ста задачах это две дополнительно решённые.

DeepSWE — более заметный отрыв Astra: 74,1% против 69,9%. OpenAI отдельно подчёркивает, что лучшая конфигурация Astra решает эти задачи примерно на 57% дешевле предыдущей модели GPT-5.6 Sol. Обратите внимание: это сравнение с собственной предшественницей, а не с Claude.

В сводном индексе агентного кодинга, который усредняет несколько независимых наборов, впереди Fable 5.1: 70 против 67. Так бывает, когда одна модель сильнее на отдельных тестах, а другая ровнее на всём наборе.

  • Терминальные задачи: Astra впереди на два пункта.
  • DeepSWE: Astra впереди на четыре пункта.
  • Сводный индекс агентного кодинга: Fable 5.1 впереди на три пункта.

Сложный код: паритет

FrontierCode — набор самых тяжёлых задач на программирование. Результаты: Astra 53,3%, Fable 5.1 53,5%, Opus 5 53,4%. Три модели от двух компаний уместились в две десятых процента.

Вывод отсюда неприятен для маркетинга обеих компаний и полезен для вашего бюджета: на действительно сложном коде флагманы упёрлись в один потолок, и Opus 5 за половину цены упирается в него же. Если ваша работа — писать и править код, а не гонять суточные автономные прогоны, переплата за флагман любой из компаний может не окупиться.

Управление компьютером

Это дисциплина, где Astra выигрывает без оговорок. 92,7% против 87,3% на ScreenSpot-Pro, 72,6% на OSWorld 2.0 и почти вдвое меньшее время на задачу, чем у предыдущего поколения OpenAI. Для автотестов через интерфейс, для агентов, работающих с программами без API, для автоматизации рутины в браузере — это серьёзное преимущество.

Интересная деталь из замеров безопасности: в сценариях управления компьютером Astra допускает нежелательные действия в 2,4% случаев, Fable 5.1 — в 9,5%. Если агент получает доступ к реальной машине с реальными данными, эта цифра важнее процента на бенчмарке.

Обратная сторона: защитные проверки Astra в API не спрашивают подтверждения, а останавливают задачу целиком. Для ночного автономного прогона это означает, что утром вы можете найти остановленную на полпути работу.

  • Точность работы с интерфейсами: Astra 92,7%, Fable 5.1 87,3%.
  • Нежелательные действия агента: Astra 2,4%, Fable 5.1 9,5%.
  • Проверки безопасности Astra могут остановить задачу в API без запроса.

Codex против Claude Code

Модель редко используют голой — обычно она работает внутри агентной обвязки. У OpenAI это Codex, у Anthropic — Claude Code. Обе обвязки зрелые: терминал, работа с репозиторием, запуск тестов, подагенты.

В Codex вместе с Astra появились экспериментальные заметки по контексту с поиском — способ переносить знания между окнами контекста. В Claude Code упор сделан на другое: навыки, хуки, подключение внешних инструментов по MCP, параллельные подагенты и фоновые задачи.

Практический критерий выбора здесь скучный, но честный: в какой обвязке уже живёт ваша команда. Перенос настроек, инструкций проекта, привычек и интеграций с одной платформы на другую стоит дороже, чем два пункта на любом бенчмарке.

Сколько стоит агентная сессия

Ценник за токен у моделей одинаковый, но агент, который пишет код, — это десятки шагов с большим стабильным контекстом: системная инструкция, описания инструментов, прочитанные файлы, история. Весь этот объём на каждом шаге читается из кеша.

Чтение кеша у Astra стоит 1 доллар за миллион токенов, у Fable 5.1 — 0,25. Сессия на 50 шагов с префиксом в 120 тысяч токенов — это 6 миллионов прочитанных из кеша токенов: около 6 долларов на Astra и около полутора на Fable 5.1.

Второй нюанс — порог длинного контекста. У Astra запрос с входом больше 272 тысяч токенов переоценивается целиком: вход и кеш вдвое дороже, выход в полтора раза. Работа с большим монорепозиторием пересекает этот порог легко. У Fable 5.1 прайс единый на всё окно.

Справедливости ради: по данным OpenAI, Astra тратит на задачах по коду примерно втрое меньше исходящих токенов, чем GPT-5.6 Sol. Прямого сравнения расхода токенов с Fable 5.1 никто не публиковал, поэтому итоговую стоимость задачи можно узнать только замером.

  • Чтение кеша: 1,00 против 0,25 доллара за миллион.
  • У Astra свыше 272K входящих токенов запрос дорожает целиком.
  • Расход токенов на задачу у моделей разный — нужен собственный замер.

Как выбирать

Агент кликает по интерфейсам или вы строите автоматизацию рабочего стола — берите Astra. Длинные сессии в большом репозитории, команда уже работает в Claude Code, важна предсказуемая стоимость — берите Fable 5.1, а для повседневных задач оставьте Opus 5 или Sonnet 5.

И не забывайте про третий вариант, который показывает FrontierCode: возможно, вам не нужен флагман вообще. Большая часть повседневной разработки решается на Opus 5 и Sonnet 5 с первого раза, и двукратная переплата за токен там ничего не покупает.

Через наш шлюз доступны все модели Claude, включая Fable 5.1, и Claude Code настраивается сменой базового URL. GPT-6 Astra у нас нет — мы работаем только с моделями Anthropic.

  • Интерфейсы и автоматизация рабочего стола — GPT-6 Astra.
  • Длинные сессии в репозитории и Claude Code — Fable 5.1.
  • Повседневная разработка — Opus 5 или Sonnet 5.

Что дальше

Если планируете внедрять Claude API в продакшн, начните с понятной структуры тарифа и сразу настройте контроль расхода токенов в личном кабинете.