Anthropic-ի Sonnet 5.5-ը մոտենում է Opus-ին աշնանային արհեստական բանականության մրցավազքում

Ամենադիտվածներ

Minimalist line art illustration of a human profile with a connected neural network node symbol

Արագ Ընթերցում

  • Anthropic-ը գործարկել է Claude Sonnet 5.5-ը սեպտեմբերի 28-ին՝ հաջորդելով Opus 5.5-ի սեպտեմբերյան շնորհանդեսին:
  • Artificial Analysis-ի տվյալներով՝ Sonnet 5.5-ը ստացել է 56 միավոր Intelligence Index-ում՝ փոքր-ինչ զիջելով Opus 5.5-ի 58 միավորին:
  • Sonnet 5.5-ի մուտքային և ելքային նշանների գները կազմում են Opus 5.5 մակարդակի գների կեսը:
  • Կոդավորման նախնական արդյունքները ցույց են տալիս, որ Sonnet 5.5-ը գերազանցում է մի շարք մրցակիցների Terminal-Bench 4.0 թեստում:
Anthropic ընկերությունը թողարկել է Claude Sonnet 5.5-ը՝ իր միջին կարգի մոդելը մոտեցնելով առաջատար հնարավորություններին՝ մինչդեռ նշանային արժեքները զգալիորեն ցածր են, ինչպես հաղորդում է The Rundown-ը։ Սեպտեմբերի 28-ի թողարկումը հաջորդում է սեպտեմբերի 22-ին ներկայացված Claude Opus 5.5-ի գործարկմանը՝ ուժեղացնելով մրցակցային ճնշումը արհեստական բանականության ոլորտում, քանի որ ծրագրավորողները վերլուծում են արժեքը, արագությունը և տրամաբանական խորությունը։

Առավելագույն աշխատանքային կարգավորումների դեպքում Artificial Analysis-ը Sonnet 5.5-ին շնորհել է 56 միավոր իր «Intelligence Index»-ում՝ զիջելով միայն Opus 5.5-ին, որը ստացել է 58 միավոր։ Միջին կարգի մոդելը գրեթե հավասարվել է Opus-ին այնպիսի գրասենյակային թեստերում, ինչպիսիք են GDPval-AA-ն և AA-Briefcase-ը, իսկ AutomationBench-AA-ում գրանցել է 71%՝ Opus-ի 70%-ի դիմաց։ Terminal-Bench 4.0 կոդավորման թեստում Artificial Analysis-ը գրանցել է 64% Sonnet-ի համար՝ գերազանցելով և՛ Opus-ին, և՛ GPT-6 Astra-ին, որոնք հավաքել են մոտ 60%։ Այդ ցուցանիշները դեռևս նախնական են, քանի որ փորձարկողները նշել են կառուցվածքային ելքային սխալի առկայությունը և պլանավորել են կրկնակի թեստավորումներ։

Ծախսերի, արագության և գործառնական փոխզիջումների հարցը

Anthropic-ը հայտնում է, որ Sonnet 5.5-ն ապահովում է առնվազն 30%-ով ավելի արագ ելքային տվյալներ, քան Sonnet 5-ը, իսկ առաջադրանքների արժեքը նվազել է մինչև 30%-ով։ Sonnet 5.5-ի մուտքային և ելքային նշանների գները կազմում են Opus 5.5-ի գների կեսը, որն իր հերթին ժամանել էր մուտքային ու ելքային նշանների 20% գների նվազեցմամբ։ Այնուամենայնիվ, իրական ծախսերը մեծապես կախված են նշանների սպառումից։ Artificial Analysis-ը առավելագույն ջանք պահանջող առաջադրանքների արժեքը գնահատել է մոտ 7.60 դոլար՝ մոտ 50%-ով ավելի թանկ, քան Sonnet 5-ը, ինչը ցույց է տալիս, որ բարձր տրամաբանական ջանքերը մեծացնում են տեխնիկական ծանրաբեռնվածությունը։

The New Stack-ի կողմից անցկացված ընդարձակ թեստավորումը, որը համեմատում է Opus 5.5-ը և մրցակից Fable 5.1-ը, ընդգծում է այն նրբերանգային փոխզիջումները, որոնց բախվում են ծրագրավորողները տրամաբանական խորության և կատարման արագության միջև։ Մինչ Opus մոդելները գերազանցում են բարդ բազմաքայլ առաջադրանքներում, նրանց չափազանց շատ մտածելու միտումը կարող է բարձրացնել նշանների քանակը և ժամանակը։ Հակառակը, ավելի արագ մոդելները ռիսկի են դիմում շրջանցելու կրիտիկական ինտեգրման ստուգումները։ Sonnet 5.5-ը ներմուծում է կիբերանվտանգության նոր պաշտպանական մեխանիզմներ, որոնք ունակ են բարձր ռիսկային հարցումները ուղղորդել դեպի Sonnet 5, ինչը ճարտարագիտական թիմերից պահանջում է ստուգել, թե ինչպես են ավտոմատ պահեստային ուղիները ազդում հավելվածների վարքագծի վրա։

Ռազմավարական ժամանակացույցը մինչև արդյունաբերական իրադարձությունները

Anthropic-ի սեպտեմբերյան երկակի թողարկումները համընկան այն պահի հետ, երբ OpenAI-ը պատրաստվում էր բացել իր DevDay համաժողովը։ Գների կառուցվածքի փոփոխության և միջին կարգի մոդելների կատարողական բացը կրճատվելու պայմաններում ճարտարագիտական թիմերը ստիպված են կշռել հաջողված ավարտի ցուցանիշները, հաշվարկված նշանները, ուշացումները և մարդկային վերանայման պահանջները՝ նախքան ենթակառուցվածքային խնայողությունների կանխատեսում անելը։

Հետևեք մեզ Telegram-ում
|
Խմբագրական ներդրում:Ազատ TV Խմբագրություն
|
Հրատարակիչ:Ազատ TV

Ամենաթարմ