GPT-5.6 Sol от OpenAI утроил результат в ARC-AGI-3 до 38,3%, вызвав дискуссию с ARC Prize

Популярные

The OpenAI logo centered on a dark brown background with digital number patterns

Быстрое чтение

  • GPT-5.6 Sol от OpenAI набрала 38,3% в ARC-AGI-3 с помощью настроек API, обойдя Claude Opus 5 с его 30,2%.
  • В стандартной тестовой среде результат составлял лишь 13,3% из-за удаления рассуждений и усечения контекста.
  • Использовались функции Retained Reasoning (сохранение рассуждений) и Compaction (сжатие истории контекста).
  • Сооснователь ARC Prize Франсуа Шолле признал, что стандартные условия ставили OpenAI в невыгодное положение.

Лаборатории искусственного интеллекта продолжают искать новые способы оптимизации результатов в бенчмарках ARC-AGI, разработанных специально для проверки способности ИИ решать сложные абстрактные задачи. Компания OpenAI опубликовала новый технический анализ, демонстрирующий, что ее модель GPT-5.6 Sol почти утроила свой показатель на публичном наборе задач ARC-AGI-3, поднявшись с 13,3% до 38,3%. Это позволило OpenAI обойти модель Claude Opus 5 от Anthropic, которая ранее удерживала рекорд с результатом в 30,2%.

Однако этот скачок был достигнут не в стандартной тестовой среде бенчмарка. Вместо этого OpenAI запустила модель через собственный Responses API с включением двух специфических настроек: «сохранение рассуждений» (Retained Reasoning) и «сжатие контекста» (Compaction). Это событие вновь разожгло дискуссию о том, отражают ли результаты тестов реальный общий искусственный интеллект (AGI) или же они являются следствием оптимизации тестового окружения.

Суть проблемы: почему стандартная среда ограничивала GPT-5.6 Sol

По словам исследователей OpenAI Илана Биджио и Теда Сандерса, они начали детальный анализ после того, как GPT-5.6 Sol показала скромный результат в 7,8% на ранних тестах ARC-AGI-3, в то время как более старая модель GPT-5.5 набрала лишь 0,4%. Эти цифры выглядели странно на фоне успехов GPT-5.6 Sol в других сложных средах: модель успешно прошла игру Pokémon FireRed, используя только зрение, играла в Slay the Spire 2 с помощью инструментов Codex и справлялась со сложными этапами головоломки Baba Is You.

Как выяснилось, стандартная тестовая среда ARC-AGI-3 содержала два критических ограничения:

  • Сброс рассуждений: После каждого действия агента система удаляла цепочку его скрытых рассуждений. Из-за этого модели приходилось заново анализировать правила игры на каждом ходу.
  • Циклическое усечение: Стандартная среда удаляла старые части диалога, как только объем контекста превышал 175 000 символов, лишая модель памяти о ранних этапах игры.

В результате модель выглядела неэффективной, постоянно застревая на анализе элементарных шагов и не накапливая опыт в процессе прохождения.

Техническое решение и позиция ARC Prize

Поскольку GPT-5.6 Sol работает на базе Responses API от OpenAI, инженеры перенастроили тестовую среду. Передавая идентификатор предыдущего ответа, они сохранили непрерывность рассуждений модели между ходами. Кроме того, усечение контекста заменили функцией «сжатия» (Compaction), которая архивирует и резюмирует старую историю диалога вместо ее полного удаления.

В итоге модель не только успешно прошла все шесть уровней тестовой игры (где ранее ни одна передовая модель не могла преодолеть первый уровень), но и сократила потребление токенов примерно в шесть раз. OpenAI рекомендовала разработчикам использовать Responses API с сохранением рассуждений и сжатием контекста для любых длительных задач.

Сооснователь ARC Prize Франсуа Шолле признал результаты OpenAI, разделив тестовые среды на два типа. Он отметил, что специализированные среды, созданные под конкретный тест, остаются под запретом. Однако общедоступные настройки API, не разрабатывавшиеся специально для ARC-AGI-3, легитимны. Шолле фактически согласился, что стандартный тест ARC ставил модель OpenAI в невыгодное положение, и подтвердил, что организация уже работает с OpenAI над интеграцией серверного управления контекстом в официальные правила тестирования.

|
Создатель:Редакция Azat TV

Самые последние