Գաղտնի փորձարկումները սկսվել են սեպտեմբերի 17-ին, երբ LMArena վարկանիշային աղյուսակում հայտնվել է «Gemini 3.8 Flash» անվանումով մոդելը: Փորձարկողները նկատել են, որ համակարգը գեներացնում է SVG գրաֆիկա և ինտերակտիվ 3D արդյունքներ, որոնք գերազանցում են թեթև մոդելների հնարավորությունները: Սեպտեմբերի 26-ին հայտնվել է Argon ներքին կոդային անվան տակ աշխատող լրիվ փաթեթը՝ կցված բենչմարկային միավորներով:
Բարձր արդյունավետություն և գործառնական հնարավորություններ
Արտահոսած տվյալները ներառում են 88% ցուցանիշ DeepSWE v1.1-ում գործակալային ծրագրավորման համար, 95.3% Terminal-bench 2.1-ում և 86.8% OSWorld-2.0-ում: Վերջինս գնահատում է, թե որքան լավ կարող է մոդելը ինքնուրույն կառավարել համակարգիչը: Վերլուծաբանները նշում են, որ այս միավորները գերազանցում են OpenAI-ի GPT-6 Astra-ին և Anthropic-ի Claude Fable 5.1-ին:
Google-ը պաշտոնապես չի հաստատել տեղեկատվությունը, մոդելի ինքնությունը կամ թողարկման ամսաթիվը: Իրական Gemini 3.8 Flash-ը թողարկվել էր սեպտեմբերի 2-ին, ինչը ծառայել է որպես թաքցման միջոց. կույր թեստավորում անցկացնող փորձագետները չէին կարող տարբերել բյուջետային մոդելը հաջորդ եռամսյակի առաջատարից:
Շուկայական մրցակցություն և գնային քաղաքականություն
Արտահոսած աղյուսակում նշված են նաև մուտքային տոկենների համար 2.25 դոլար և ելքային տոկենների համար 11.25 դոլար արժեքներ՝ միլիոն տոկենի հաշվով: Համեմատության համար նշենք, որ OpenAI-ի GPT-6 Sol-ն արժե 2 և 10 դոլար: Հաստատվելու դեպքում այս գները կվկայեն, որ Google-ը մտադրված է գերազանցել մրցակիցներին և ցածր պահել գները:
Այս զարգացումները տեղի են ունենում Anthropic-ի կողմից Claude Fable 5.1-ի և Claude Opus 5.5-ի, ինչպես նաև OpenAI-ի կողմից GPT-6 Sol-ի ու Luna-ի թողարկումների ֆոնին, ինչը էլ ավելի է սրում արհեստական բանականության շուկայում գների և կարողությունների մրցավազքը:
Թերահավատություն և մեթոդաբանական հարցեր
Արդյունաբերության փորձագետները զգուշավորություն են պահպանում կույր թեստերի արդյունքների նկատմամբ: Նմանատիպ արտահոսքերը հաճախ պահանջում են խիստ մեթոդաբանական ստուգում, քանի որ չափանիշները չեն պատմում այն մասին, թե ինչպես է մոդելը հաղթահարում բիզնեսի առօրյա բարդ խնդիրները:

