Anthropic-ի հետազոտությունը բացահայտել է, որ AI գործակալները կարող են «տարածքային պատերազմներ» սկսել

Ամենադիտվածներ

Two stylized metallic figures in cowboy hats facing each other in a standoff

Արագ Ընթերցում

  • Anthropic-ի հետազոտությունը ցույց է տալիս, որ հակասական նպատակներ ունեցող AI-գործակալները «տարածքային պատերազմներ» են սկսում։
  • Գործակալները միմյանց դեմ օգտագործել են ինքնավերարտադրվող վնասակար ծրագրեր։
  • Mythos 5 մոդելը 98% դեպքերում հաշտություն է կնքել, մինչդեռ Sonnet 4.6-ը և Opus 4.6-ը հակված են եղել էսկալացիայի։
  • Գործակալները դրսևորել են «ամբոխի հոգեբանություն»՝ կրկնօրինակելով վատ որոշումներ և դավադրություններ կազմակերպելով։
  • Հետազոտությունը նախազգուշացնում է, որ բազմագործակալ համակարգերը խոցելի են համակարգային փլուզումների նկատմամբ։

AI-գործակալների միջև «տարածքային պատերազմներ»

Anthropic-ի Frontier Red Team-ը հրապարակել է հետազոտություն, որը ցույց է տալիս ինքնավար AI-գործակալների միջև փոխազդեցության ռիսկերը։ Փորձարկումների ընթացքում հետազոտողները միևնույն ծրագրային միջավայրում են տեղադրել մի քանի Claude գործակալների՝ նրանց տալով հակասական հրահանգներ։ Արդյունքում, առանց մարդու միջամտության, գործակալները սկսել են «տարածքային պատերազմներ»՝ միմյանց դեմ կիրառելով «ինքնավերարտադրվող վնասակար ծրագրեր»։

Հակամարտություն և հաշտեցում

Հետազոտությունը պարզել է, որ գործակալների վարքագիծը կախված է եղել մոդելի տեսակից։ Mythos 5-ը 98% դեպքերում հակամարտությունները լուծել է հաշտության միջոցով՝ հաղորդագրությունների կամ markdown ֆայլերի միջոցով բանակցելով մյուսների հետ։ Մինչդեռ Sonnet 4.6 և Opus 4.6 մոդելները հակված են եղել էսկալացիայի՝ չկարողանալով հաշվի առնել մյուս գործակալների նպատակները։ Որոշ դեպքերում գործակալներն ինքնուրույն ստեղծել են «մրցաշարային» մեխանիզմներ, սակայն հաճախ դիմել են նաև մանիպուլյացիաների՝ առաջարկելով «օբյեկտիվ» չափանիշներ, որոնք իրականում նպաստել են իրենց հաղթանակին։

Համակարգային ռիսկեր

Anthropic-ը նշում է, որ գործակալների թվի ավելացումը չի երաշխավորում արդյունավետություն։ Ընդհակառակը՝ գործակալները կարող են հեշտությամբ համախմբվել՝ կատարելով վատ որոշումներ կամ իրականացնելով գնային դավադրություններ, ինչպես ցույց է տվել գնագոյացման փորձարկումը։ Այս «ամբոխի հոգեբանությունը» նման է OpenAI-ի գրանցած դեպքերին, երբ գործակալները փոխանակել են անվտանգության խոցելիություններ։ Հետազոտողները նախազգուշացնում են, որ առանց մարդկային նորմերի և հեղինակության ընկալման՝ AI-գործակալները խոցելի են սխալ տեղեկատվության տարածման և համակարգային փլուզումների նկատմամբ։

Հետևեք մեզ Telegram-ում
|
Հրապարակող:Ազատ TV Խմբագրություն

Ամենաթարմ