Утекшие данные тестов указывают на необъявленный флагманский ИИ-модель Google

Популярные

Close up shot of a complex futuristic white and metallic processor architecture

Быстрое чтение

  • Необъявленная модель Google под кодовым именем Argon появилась в таблицах лидеров.
  • Утекшие баллы превосходят результаты GPT-6 Astra от OpenAI и Claude Fable 5.1 от Anthropic.
  • Предварительные цены составляют .25 за миллион входных и .25 за миллион выходных токенов.
  • Google официально не подтвердила результаты бенчмарков или сроки выпуска.
Высокопроизводительный чекпоинт искусственного интеллекта Google, замаскированный под легковесную модель, появился в публичных рейтингах, продемонстрировав результаты тестов, которые превосходят новейшие релизы OpenAI и Anthropic, сообщает Startup Fortune.

Скрытное развертывание началось 17 сентября, когда модель под названием «Gemini 3.8 Flash» появилась в таблице лидеров LMArena. Тестировщики заметили, что система генерирует SVG-графику и интерактивный 3D-контент, что выходит за рамки стандартных бюджетных моделей. К 26 сентября появился более полный чекпоинт под внутренним кодовым именем Argon с прикрепленными баллами бенчмарков.

Рекордные показатели и возможности агента

Утекшие результаты включают 88% в DeepSWE v1.1 для агентского программирования, 95.3% в Terminal-bench 2.1 и 86.8% в OSWorld-2.0, оценивающей способность модели самостоятельно управлять компьютером. Разработчики отмечают, что эти показатели превосходят OpenAI GPT-6 Astra и Anthropic Claude Fable 5.1 в задачах рассуждения и кодирования.

Google официально не подтвердила подлинность чекпоинта, показатели и дату релиза. Фактический Gemini 3.8 Flash был выпущен 2 сентября, что послужило прикрытием для слепого тестирования нового флагмана.

Ценовое давление и осенняя гонка ИИ

В утекшей таблице также указаны предполагаемые цены: $2.25 за миллион входных токенов и $11.25 за миллион выходных. Для сравнения, GPT-6 Sol от OpenAI обходится в $2 и $10. Если цены подтвердятся, Google сможет предложить более мощную модель по конкурентной стоимости.

События разворачиваются на фоне активного запуска новых моделей от Anthropic (Claude Fable 5.1 и Opus 5.5) и OpenAI (GPT-6 Sol и Luna), что делает рынок еще более напряженным.

Скептицизм и вопросы методологии

Отраслевые эксперты призывают к осторожности в отношении данных слепого тестирования. Подобные утечки требуют тщательной проверки методологии, поскольку стандартные тесты не всегда отражают реальную эффективность моделей в сложных корпоративных задачах.

|
Редакционный вклад:Редакция Azat TV
|
Издатель:Azat TV

Самые последние