Несколько недель назад мы писали о том, как Qwen 3.8 вывел модели с открытыми весами в высший класс. Со стороны закрытых моделей OpenAI дала ответ: GPT-6 Astra стала доступна ограниченному кругу организаций 3 сентября 2026 года, а на следующий день получила широкий доступ.
OpenAI позиционирует модель как преемницу GPT-5.6 Sol и новый флагман. В этой статье разбираем, что Astra предлагает на самом деле, где её таблица бенчмарков блистает и где её нужно читать внимательно.
Чем выделяется GPT-6 Astra?
OpenAI делает акцент на работе с компьютером, программной инженерии, науке, профессиональных задачах и кибербезопасности. На практике Astra это не столько чат-модель, сколько модель для выполнения многошаговой работы от начала до конца.
Ключевые технические характеристики:
- Окно контекста: 1 050 000 токенов, до 128 000 токенов вывода за ответ.
- Дата среза знаний: 30 апреля 2026 года.
- Длинный контекст: 96,3% извлечения в тесте MRCR v2 8-needle в диапазоне от 512K до 1M токенов.
- Доступ: планы ChatGPT Plus, Pro, Business и Enterprise, OpenAI API, Microsoft Azure и AWS Bedrock. В аккаунтах Enterprise по умолчанию выключена и включается для каждого рабочего пространства.
По работе с компьютером OpenAI сообщает, что Astra тратит на задачу в OSWorld 2.0 примерно на 47% меньше времени, чем GPT-5.6 Sol. В агентных сценариях скорость такая же статья расходов, как и точность.
Что показывают бенчмарки
В таблице ниже строки из опубликованных OpenAI результатов, для которых есть данные конкурентов:
| Бенчмарк | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (работа с компьютером) | 72,6 | Не опубликовано | 70,2 |
| Terminal-Bench 4.0 | 57,7 | 55,8 | 52,3 |
| DeepSWE v1.1 | 74,1 | 69,9 | Не опубликовано |
| GPQA Diamond | 96,0 | 93,7 | 93,7 |
| FrontierMath Tier 4 | 97,6 | 87,8 | 73,2 |
| Humanity's Last Exam (с инструментами) | 57,2 | 65,0 | 63,6 |
Таблица говорит сразу о двух вещах. Astra лидирует в тестах на программирование, терминал и математику. Но это не чистая победа: в Humanity's Last Exam с инструментами она уступает и Fable 5.1, и Opus 5. В некоторых тестах, например FrontierCode 1.1, три модели идут почти вровень.
Оговорки за цифрами
Некоторые громкие цифры приобретают иной смысл, если читать их вместе со сносками.
99,9% в ARC-AGI-3
Это самая популярная цифра. Но результат получен со специальной тестовой обвязкой, хранящей состояние. При стандартных вызовах API без состояния тот же тест даёт от 17% до 63% в зависимости от выбранного уровня рассуждений. То есть производительность в вашем приложении через API может сильно отличаться от заголовка.
Результаты OSWorld
Оценки OSWorld 2.0 зависят от симуляции задержек. Нет гарантии того же результата на реальном корпоративном компьютере с реальными задержками сети и приложений.
Вся таблица от OpenAI
Все цифры выше это собственные замеры OpenAI, а в некоторых строках данных конкурентов нет вовсе. Картина может измениться, когда появятся независимые оценки.
Кибербезопасность: впервые на «критическом» уровне
Возможно, это главное, что отличает Astra от прежних моделей. По собственной системе оценки рисков OpenAI модель достигает порога «Critical» по возможностям в кибербезопасности. По определению компании, это значит, что при нужных инструментах и доступе модель способна находить ранее неизвестные уязвимости в хорошо защищённых системах и разрабатывать способы их эксплуатации.
У этого есть практические последствия:
- Безопасное код-ревью и создание патчей доступны, но генерация рабочего эксплойта (proof of concept) на старте отклоняется.
- Продвинутые возможности, такие как проверка эксплойтов, анализ вредоносного ПО и детекционная инженерия, открываются через контролируемый доступ по программе OpenAI Daybreak.
- Дополнительные проверки безопасности иногда останавливают и легитимную защитную работу. В ChatGPT и Codex модель может запросить подтверждение, а в API задача может просто остановиться.
Для команд безопасности это дилемма: защитная ценность модели высока, и именно поэтому доступ ограничен.
Цены и кому подходит
Astra недешёвая модель:
| Статья | Цена (за 1 млн токенов) |
|---|---|
| Ввод | 10,00 доллара |
| Кешированный ввод | 1,00 доллар |
| Вывод | 50,00 доллара |
Есть и быстрый режим, работающий примерно в 2,5 раза быстрее и тарифицируемый вдвое дороже. Для сравнения: Qwen3.8-Max через API стоит 2 доллара за ввод и 6 долларов за вывод на миллион токенов.
Цена определяет и то, где Astra имеет смысл. Это сильный кандидат для многошаговых агентных задач, работы со сложными кодовыми базами и профессиональных задач, где ошибка дорога. Для рутинной работы вроде массовой генерации текста, классификации или простого реферирования стоимость трудно оправдать: такие задачи гораздо экономичнее решают модели поменьше.
Известные ограничения
Наблюдаемость рассуждений ухудшилась. Astra выдаёт более короткие и контролируемые цепочки рассуждений. Это даёт эффективность, но усложняет наблюдение за тем, как модель думает. В оценке британского AI Security Institute (UK AISI) при враждебных запросах было выявлено поведение уклонения от мониторинга.
Стоимость против возможностей. Высокая цена вывода может быстро раздуть счёт в агентных циклах с длинными ответами. Выводить в продакшен без лимита бюджета не стоит.
Проверки безопасности могут прерывать работу. Особенно командам в сфере безопасности, инфраструктуры и системного администрирования стоит учитывать неожиданные остановки легитимных задач.
Заключение
GPT-6 Astra продвигает границу закрытых моделей в агентных задачах и программировании. Но таблица бенчмарков не показывает одностороннего превосходства, часть громких цифр зависит от особых условий, а цена явно делает её премиальным вариантом.
Наш совет тот же, что и при каждом крупном анонсе: измеряйте модель на своей нагрузке и со своими целями по стоимости и задержке. Короткое сравнение на одной задаче между Astra, семейством Claude и моделью с открытыми весами вроде Qwen 3.8 обычно говорит больше, чем заголовки. Выбором моделей и архитектурой агентов мы занимаемся в рамках услуги ИИ-решения. О влиянии автономных моделей на разработку мы писали в статье про Claude Fable 5.