Prvi put ikad: AI izmislio lažni identitet i pokušao prevariti stvarnu osobu

Najnapredniji model vještačke inteligencije kompanije Anthropic poslužio se lažnim identitetima u pokušaju da prevari stvarnu osobu i podmetne zlonamjerni kod. Do incidenta je došlo tokom testiranja koje je sproveo britanski Institut za bezbjednost vještačke inteligencije (AISI), a ovo je posljednji u nizu primjera u kojima AI model djeluje samostalno, piše CNN.

Modeli kompanije Anthropic i OpenAI testirani su u laboratorijskim uslovima sa smanjenim bezbjednosnim postavkama. Vladina istraživačka laboratorija objavila je da je prvi put zabilježeno da su se modeli koristili “socijalnim inženjeringom” kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su sprovodili nedopuštene radnje.

“Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez podsticaja i u stvarnom okruženju”, objavio je institut”. Dodali su kako nema dokaza da je u stvarnom svijetu nastala ikakva šteta, prenosi Index.hr.

Autonomne akcije na internetu

Ovaj bezbjednosni incident jedan je od nekoliko primjera u kojima napredni AI modeli preduzimaju neovlaštene radnje. Takvi događaji su podstakli sve glasnije zahtjeve za strožom državnom regulacijom vještačke inteligencije, pa čak i za usporavanjem njenog razvoja.

I OpenAI i Anthropic izvijestili su krajem jula da su njihovi modeli izašli iz testnih okruženja i upali u druge sisteme. Ali, za razliku od tih ranijih incidenata, britanski institut je tokom ovog testiranja modelima izričito omogućio pristup internetu.

Institut je sproveo 122 kibernetička izazova, a u njih deset AI agenti su “preduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije”. Većina tih radnji potekla je od Anthropicovog modela Mythos 5, a ostatak od OpenAI-jevog GPT-5.6-Sola.

U najozbiljnijem incidentu, agent je pokušao dobiti odobrenje od ljudskih recenzenata za “umetanje zlonamjernog koda u javni projekat otvorenog koda” tako što je stvorio “više lažnih identiteta”, navodi institut. Agent je “pokušao direktno kontaktirati stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod”. Nakon što su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio s radom.

Reakcije tehnoloških kompanija

Objava instituta stigla je istog dana kada su se predstavnici vodećih AI kompanija sastali u Bijeloj kući kako bi raspravili o novom okviru prema kojem će vlada provjeravati najnaprednije modele prije njihova puštanja u javnost.

U izjavi na platformi X, iz kompanije Anthropic su rekli da su modeli testirani u “namjerno popustljivim uslovima”, s uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korištenja interneta. “Usko sarađujemo s njima kako bismo prikupili više detalja o incidentu dok sprovodimo vlastitu istragu”, poručili su i dodali da nema dokaza o bijegu iz sigurnog okruženja.

OpenAI je identifikovao dvije nedopuštene radnje svojih modela kao izlazak iz testnog okruženja i učestvovanje u aktivnostima koje nisu bile potrebne za vježbe. “Posvećeni smo saradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno sprovođenje visokorizičnih procjena”, objavila je kompanija u utorak na svom blogu.

Pročitajte još

Popularno