OpenAI-ի GPT-5.6 Sol-ը եռապատկել է իր արդյունքը ARC-AGI-3 թեստում՝ առաջացնելով ARC Prize-ի արձագանքը

Ամենադիտվածներ

The OpenAI logo centered on a dark brown background with digital number patterns

Արագ Ընթերցում

  • GPT-5.6 Sol-ը ARC-AGI-3 թեստում գրանցել է 38,3% արդյունք՝ շրջանցելով Claude Opus 5-ի 30,2% ցուցանիշը։
  • Ստանդարտ միջավայրում մոդելը հավաքել էր ընդամենը 13,3%՝ դատողությունների կորստի և կոնտեքստի կրճատման պատճառով։
  • Օգտագործվել են «Retained Reasoning» (դատողությունների պահպանում) և «Compaction» (կոնտեքստի ամփոփում) կարգավորումները։
  • ARC Prize-ի համահիմնադիր Ֆրանսուա Շոլեն ընդունել է, որ ստանդարտ համակարգը թերություններ է ունեցել OpenAI-ի նկատմամբ։

Արհեստական բանականության (ԱԲ) ոլորտի առաջատար OpenAI ընկերությունը հրապարակել է նոր հետազոտական վերլուծություն, որի համաձայն՝ իր նորագույն GPT-5.6 Sol մոդելի արդյունքները ARC-AGI-3 բարդագույն թեստավորման համակարգում (benchmark) գրեթե եռապատկվել են՝ 13,3%-ից հասնելով 38,3%-ի։ Այս ցուցանիշով OpenAI-ի մոդելը շրջանցել է Anthropic ընկերության Claude Opus 5 մոդելին, որի գրանցած ռեկորդային արդյունքը կազմում էր 30,2%։

Այնուամենայնիվ, այս թռիչքային աճը չի գրանցվել պաշտոնական թեստային միջավայրում (harness)։ Դրա փոխարեն OpenAI-ի հետազոտողներ Իլան Բիջիոն և Թեդ Սանդերսը մոդելը գործարկել են սեփական Responses API-ի միջոցով՝ ակտիվացնելով երկու կարևոր կարգավորում՝ «պահպանված դատողություն» (Retained Reasoning) և «խտացում» (Compaction)։ Այս քայլը նոր թափ է հաղորդել տեխնոլոգիական ոլորտում ընթացող այն բանավեճին, թե արդյոք թեստերի արդյունքները արտացոլում են մոդելի իրական ընդհանուր բանականությունը (AGI), թե՞ պարզապես թեստային միջավայրի ճարտարագիտական հարմարեցման արդյունք են։

Ինչու՞ էր ստանդարտ միջավայրը սահմանափակում մոդելին

OpenAI-ի մասնագետները սկսել են ուսումնասիրել խնդիրը այն բանից հետո, երբ GPT-5.6 Sol-ը նախնական թեստերում հավաքել էր ընդամենը 7,8% արդյունք, իսկ ավելի հին GPT-5.5 տարբերակը՝ հազիվ 0,4%։ Սա տարօրինակ էր, քանի որ այլ բարդ միջավայրերում մոդելը բարձր արդյունավետություն էր ցուցադրել. այն հաջողությամբ անցել էր Pokémon FireRed խաղը՝ օգտագործելով միայն տեսողական տվյալներ, Codex-ի գործիքներով խաղացել էր Slay the Spire 2 և լուծել Baba Is You տրամաբանական խաղի առաջին փուլերը։

Հետազոտողները պարզել են, որ ARC-AGI-3-ի ստանդարտ համակարգը յուրաքանչյուր քայլից հետո ջնջում էր մոդելի ներքին դատողությունների շղթան (chain of thought)։ Արդյունքում՝ ամեն հաջորդ քայլին մոդելը ստիպված էր լինում խաղի կանոնները վերծանել զրոյից։ Բացի այդ, համակարգը կիրառում էր կոնտեքստի կրճատում (rolling truncation)՝ ջնջելով 175,000 նիշից հին տվյալները, ինչի պատճառով մոդելը կորցնում էր խաղի նախորդ փուլերում արված կարևոր դիտարկումները։

Տեխնիկական լուծումը և ARC Prize-ի արձագանքը

Responses API-ի միջոցով OpenAI-ի հետազոտողները թույլ են տվել, որ մոդելի դատողությունները պահպանվեն քայլերի միջև՝ նախորդ պատասխանի ID-ն փոխանցելու միջոցով։ Իսկ տվյալների կորուստը կանխելու համար կիրառվել է «խտացման» (Compaction) գործառույթը, որը հին տեղեկատվությունը ջնջելու փոխարեն ամփոփում էր այն։ Այս փոփոխությունների շնորհիվ GPT-5.6 Sol-ը ոչ միայն հաջողությամբ լուծել է թեստային խաղի բոլոր 6 մակարդակները, այլև ծախսել է մոտ վեց անգամ պակաս տոկեն (output tokens)։

ARC Prize հիմնադրամի համահիմնադիր Ֆրանսուա Շոլեն, արձագանքելով OpenAI-ի հրապարակմանը, հստակեցրել է թեստավորման մոտեցումները։ Նա նշել է, որ հատուկ թեստի համար մշակված միջավայրերն արգելված են, սակայն ընդհանուր նշանակության API կարգավորումները, որոնք հասանելի են բոլոր օգտատերերին և ստեղծված չեն հատուկ ARC-AGI-3-ի համար, լիովին ընդունելի են։ Շոլեն փաստացի ընդունել է, որ ARC-ի ստանդարտ թեստային համակարգը OpenAI-ի մոդելին դրել էր անհավասար պայմանների մեջ։

Այժմ ARC Prize հիմնադրամը համագործակցում է OpenAI-ի և այլ լաբորատորիաների հետ՝ հասկանալու համար, թե ինչպես կարելի է սերվերային տվյալների պահպանումն ինտեգրել պաշտոնական թեստավորման մեջ՝ առանց որևէ մշակողի առավելություն տալու։

Հետևեք մեզ Telegram-ում
|
Հրապարակող:Ազատ TV Խմբագրություն

Ամենաթարմ