Лаборатории искусственного интеллекта продолжают искать новые способы оптимизации результатов в бенчмарках ARC-AGI, разработанных специально для проверки способности ИИ решать сложные абстрактные задачи. Компания OpenAI опубликовала новый технический анализ, демонстрирующий, что ее модель GPT-5.6 Sol почти утроила свой показатель на публичном наборе задач ARC-AGI-3, поднявшись с 13,3% до 38,3%. Это позволило OpenAI обойти модель Claude Opus 5 от Anthropic, которая ранее удерживала рекорд с результатом в 30,2%.
Однако этот скачок был достигнут не в стандартной тестовой среде бенчмарка. Вместо этого OpenAI запустила модель через собственный Responses API с включением двух специфических настроек: «сохранение рассуждений» (Retained Reasoning) и «сжатие контекста» (Compaction). Это событие вновь разожгло дискуссию о том, отражают ли результаты тестов реальный общий искусственный интеллект (AGI) или же они являются следствием оптимизации тестового окружения.
Суть проблемы: почему стандартная среда ограничивала GPT-5.6 Sol
По словам исследователей OpenAI Илана Биджио и Теда Сандерса, они начали детальный анализ после того, как GPT-5.6 Sol показала скромный результат в 7,8% на ранних тестах ARC-AGI-3, в то время как более старая модель GPT-5.5 набрала лишь 0,4%. Эти цифры выглядели странно на фоне успехов GPT-5.6 Sol в других сложных средах: модель успешно прошла игру Pokémon FireRed, используя только зрение, играла в Slay the Spire 2 с помощью инструментов Codex и справлялась со сложными этапами головоломки Baba Is You.
Как выяснилось, стандартная тестовая среда ARC-AGI-3 содержала два критических ограничения:
- Сброс рассуждений: После каждого действия агента система удаляла цепочку его скрытых рассуждений. Из-за этого модели приходилось заново анализировать правила игры на каждом ходу.
- Циклическое усечение: Стандартная среда удаляла старые части диалога, как только объем контекста превышал 175 000 символов, лишая модель памяти о ранних этапах игры.
В результате модель выглядела неэффективной, постоянно застревая на анализе элементарных шагов и не накапливая опыт в процессе прохождения.
Техническое решение и позиция ARC Prize
Поскольку GPT-5.6 Sol работает на базе Responses API от OpenAI, инженеры перенастроили тестовую среду. Передавая идентификатор предыдущего ответа, они сохранили непрерывность рассуждений модели между ходами. Кроме того, усечение контекста заменили функцией «сжатия» (Compaction), которая архивирует и резюмирует старую историю диалога вместо ее полного удаления.
В итоге модель не только успешно прошла все шесть уровней тестовой игры (где ранее ни одна передовая модель не могла преодолеть первый уровень), но и сократила потребление токенов примерно в шесть раз. OpenAI рекомендовала разработчикам использовать Responses API с сохранением рассуждений и сжатием контекста для любых длительных задач.
Сооснователь ARC Prize Франсуа Шолле признал результаты OpenAI, разделив тестовые среды на два типа. Он отметил, что специализированные среды, созданные под конкретный тест, остаются под запретом. Однако общедоступные настройки API, не разрабатывавшиеся специально для ARC-AGI-3, легитимны. Шолле фактически согласился, что стандартный тест ARC ставил модель OpenAI в невыгодное положение, и подтвердил, что организация уже работает с OpenAI над интеграцией серверного управления контекстом в официальные правила тестирования.

