Спустя три недели после публичного релиза GPT-6 Astra от OpenAI, независимые данные оценки среди исследователей искусственного интеллекта указывают на четкую функциональную дивергенцию между ведущими моделями. Согласно отчету Shattered.io, Astra продемонстрировала подавляющее преимущество над Claude Fable 5.1 от Anthropic в тестах на наступательную кибербезопасность, в то время как Fable 5.1 сохраняет лидерство в стандартных задачах разработки программного обеспечения. Этот разрыв меняет критерии корпоративных закупок и побуждает Anthropic рассмотреть возможность экстренного выпуска новой модели.
Разделение корпоративного рынка: Кибербезопасность против разработки
Разница в показателях между GPT-6 Astra и Claude Fable 5.1 заставляет корпоративные IT-отделы разделить критерии выбора ИИ-инструментов. Вместо выбора единого универсального провайдера заказчики начинают рассматривать кибербезопасность и разработку ПО как два разных направления закупок. По данным сравнительного обзора CodingFleet, в тесте обратной разработки SRE-Bench модель GPT-6 Astra решила 88.0% задач с первой попытки по сравнению с 12.5% у Claude Fable 5.1. При предоставлении четырех попыток показатель Astra вырос до 99.2%.
Аналогичный разрыв зафиксирован в тесте ExploitBench, оценивающем способность модели превращать известные уязвимости в рабочие эксплойты. В тестовой среде без ограничений GPT-6 Astra показала результат 100.0%, тогда как Claude Fable 5.1 и Claude Opus 5 набрали по 70.0%. На подмножестве уязвимостей с июня по август 2026 года Astra достигла 39.0% точности против 5.5% у GPT-5.6 Sol.
Системная карта OpenAI и «критический» уровень риска
OpenAI опубликовала официальную системную карту Astra в Deployment Safety Hub 3 сентября 2026 года. Как отмечает BleepingComputer, Astra стала первой широко развернутой моделью, получившей «Критический» (Critical) уровень кибербезопасности в рамках Preparedness Framework компании. Это означает, что модель способна самостоятельно находить неизвестные уязвимости и строить сценарии атак без пошагового участия человека.
Присвоение критического уровня влечет за собой усиленный мониторинг и ограничение доступа к инструментам по умолчанию, но не отмену релиза. В рамках внутренних тестов на 54 000 задач Codex модель Astra зафиксировала 34 флага нарушения безопасности 3-го уровня (0.063%), что на 53% меньше показателей GPT-5.6 Sol (73 флага, 0.135%).
Лидерство в кодинге: Где Claude Fable 5.1 сохраняет преимущество
Несмотря на отставание в сфере кибербезопасности, Anthropic удерживает уверенное лидерство в ключевых бенчмарках разработки ПО. По данным платформы Hokai за сентябрь 2026 года, Claude Fable 5.1 возглавляет рейтинг SWE-bench Pro с результатом 81.2%, опережая Claude Fable 5 (80.0%), Claude Opus 5 (79.2%) и GPT-5.6 Sol (64.6%). Сведения о показателях Astra в SWE-bench Pro не были официально раскрыты в полном объеме.
В тестах на общее логическое мышление Fable 5.1 набрала 97.5% в ARC-AGI-1 и 90.0% в ARC-AGI-2. Кроме того, Anthropic снизила частоту незапланированных отказов системы (unintended fallback rate) с 7.8% в Fable 5.0 до 2.1% в Fable 5.1, что имеет критическое значение для стабильности инжиниринговых процессов.
Стратегический ответ Anthropic и последствия для рынка
Огромный разрыв в исследовании уязвимостей создал серьезное стратегическое давление для Anthropic. Как сообщает Shattered.io, руководство Anthropic анализирует возможность внепланового релиза новой модели, чтобы ликвидировать отставание в 75.5 процентных пункта на SRE-Bench. Это происходит после периода, когда Anthropic приостановила часть кибер-тестов из-за инцидентов с безопасностью в начале 2026 года.
Для корпоративных клиентов текущая ситуация означают специализацию: для автоматизированной защиты и поиска уязвимостей выбирают Astra, тогда как для написания кода и проектирования архитектуры приоритетом остается Claude Fable 5.1.

