Высокопроизводительный чекпоинт искусственного интеллекта Google, замаскированный под легковесную модель, появился в публичных рейтингах, продемонстрировав результаты тестов, которые превосходят новейшие релизы OpenAI и Anthropic, сообщает Startup Fortune.
Скрытное развертывание началось 17 сентября, когда модель под названием «Gemini 3.8 Flash» появилась в таблице лидеров LMArena. Тестировщики заметили, что система генерирует SVG-графику и интерактивный 3D-контент, что выходит за рамки стандартных бюджетных моделей. К 26 сентября появился более полный чекпоинт под внутренним кодовым именем Argon с прикрепленными баллами бенчмарков.
Утекшие результаты включают 88% в DeepSWE v1.1 для агентского программирования, 95.3% в Terminal-bench 2.1 и 86.8% в OSWorld-2.0, оценивающей способность модели самостоятельно управлять компьютером. Разработчики отмечают, что эти показатели превосходят OpenAI GPT-6 Astra и Anthropic Claude Fable 5.1 в задачах рассуждения и кодирования.
Google официально не подтвердила подлинность чекпоинта, показатели и дату релиза. Фактический Gemini 3.8 Flash был выпущен 2 сентября, что послужило прикрытием для слепого тестирования нового флагмана.
Ценовое давление и осенняя гонка ИИ
В утекшей таблице также указаны предполагаемые цены: $2.25 за миллион входных токенов и $11.25 за миллион выходных. Для сравнения, GPT-6 Sol от OpenAI обходится в $2 и $10. Если цены подтвердятся, Google сможет предложить более мощную модель по конкурентной стоимости.
События разворачиваются на фоне активного запуска новых моделей от Anthropic (Claude Fable 5.1 и Opus 5.5) и OpenAI (GPT-6 Sol и Luna), что делает рынок еще более напряженным.
Скептицизм и вопросы методологии
Отраслевые эксперты призывают к осторожности в отношении данных слепого тестирования. Подобные утечки требуют тщательной проверки методологии, поскольку стандартные тесты не всегда отражают реальную эффективность моделей в сложных корпоративных задачах.
Вопросы для наблюдения
Выпустит ли Google модель Argon официально как Gemini 4 Pro?
Google пока не подтвердила график выпуска, однако отраслевые отчеты указывают на запуск флагмана до конца 2026 года
Что остается неясным: Точная дата официального релиза и финальное название остаются неизвестными
Насколько точны слепые тесты LMArena для корпоративного использования?
Хотя слепые тесты предоставляют полезные сравнительные данные, они не полностью отражают сложные реальные рабочие процессы
Что остается неясным: Надежность модели при масштабных коммерческих нагрузках трудно проверить по одним лишь таблицам лидеров
Точки зрения
Точка зрения индустрии vs Точка зрения разработчиков
Фокус
Точка зрения индустрии
Конкуренты, такие как OpenAI и Anthropic, сталкиваются с новым давлением, поскольку утекшие метрики указывают на возможное превосходство Google в производительности и ценообразовании
Точка зрения разработчиков
Инженерные команды видят в высоких баллах тестов сигнал улучшения возможностей автономных агентов, однако проверка в реальных условиях требует официального релиза модели