Առավելագույն աշխատանքային կարգավորումների դեպքում Artificial Analysis-ը Sonnet 5.5-ին շնորհել է 56 միավոր իր «Intelligence Index»-ում՝ զիջելով միայն Opus 5.5-ին, որը ստացել է 58 միավոր։ Միջին կարգի մոդելը գրեթե հավասարվել է Opus-ին այնպիսի գրասենյակային թեստերում, ինչպիսիք են GDPval-AA-ն և AA-Briefcase-ը, իսկ AutomationBench-AA-ում գրանցել է 71%՝ Opus-ի 70%-ի դիմաց։ Terminal-Bench 4.0 կոդավորման թեստում Artificial Analysis-ը գրանցել է 64% Sonnet-ի համար՝ գերազանցելով և՛ Opus-ին, և՛ GPT-6 Astra-ին, որոնք հավաքել են մոտ 60%։ Այդ ցուցանիշները դեռևս նախնական են, քանի որ փորձարկողները նշել են կառուցվածքային ելքային սխալի առկայությունը և պլանավորել են կրկնակի թեստավորումներ։
Ծախսերի, արագության և գործառնական փոխզիջումների հարցը
Anthropic-ը հայտնում է, որ Sonnet 5.5-ն ապահովում է առնվազն 30%-ով ավելի արագ ելքային տվյալներ, քան Sonnet 5-ը, իսկ առաջադրանքների արժեքը նվազել է մինչև 30%-ով։ Sonnet 5.5-ի մուտքային և ելքային նշանների գները կազմում են Opus 5.5-ի գների կեսը, որն իր հերթին ժամանել էր մուտքային ու ելքային նշանների 20% գների նվազեցմամբ։ Այնուամենայնիվ, իրական ծախսերը մեծապես կախված են նշանների սպառումից։ Artificial Analysis-ը առավելագույն ջանք պահանջող առաջադրանքների արժեքը գնահատել է մոտ 7.60 դոլար՝ մոտ 50%-ով ավելի թանկ, քան Sonnet 5-ը, ինչը ցույց է տալիս, որ բարձր տրամաբանական ջանքերը մեծացնում են տեխնիկական ծանրաբեռնվածությունը։
The New Stack-ի կողմից անցկացված ընդարձակ թեստավորումը, որը համեմատում է Opus 5.5-ը և մրցակից Fable 5.1-ը, ընդգծում է այն նրբերանգային փոխզիջումները, որոնց բախվում են ծրագրավորողները տրամաբանական խորության և կատարման արագության միջև։ Մինչ Opus մոդելները գերազանցում են բարդ բազմաքայլ առաջադրանքներում, նրանց չափազանց շատ մտածելու միտումը կարող է բարձրացնել նշանների քանակը և ժամանակը։ Հակառակը, ավելի արագ մոդելները ռիսկի են դիմում շրջանցելու կրիտիկական ինտեգրման ստուգումները։ Sonnet 5.5-ը ներմուծում է կիբերանվտանգության նոր պաշտպանական մեխանիզմներ, որոնք ունակ են բարձր ռիսկային հարցումները ուղղորդել դեպի Sonnet 5, ինչը ճարտարագիտական թիմերից պահանջում է ստուգել, թե ինչպես են ավտոմատ պահեստային ուղիները ազդում հավելվածների վարքագծի վրա։
Ռազմավարական ժամանակացույցը մինչև արդյունաբերական իրադարձությունները
Anthropic-ի սեպտեմբերյան երկակի թողարկումները համընկան այն պահի հետ, երբ OpenAI-ը պատրաստվում էր բացել իր DevDay համաժողովը։ Գների կառուցվածքի փոփոխության և միջին կարգի մոդելների կատարողական բացը կրճատվելու պայմաններում ճարտարագիտական թիմերը ստիպված են կշռել հաջողված ավարտի ցուցանիշները, հաշվարկված նշանները, ուշացումները և մարդկային վերանայման պահանջները՝ նախքան ենթակառուցվածքային խնայողությունների կանխատեսում անելը։

