AI sistemi sve teže predvidivi: OpenAI objavio primjere zabrinjavajućeg ponašanja

OpenAI je objavio šest izvještaja o neočekivanom ponašanju svojih AI modela, uključujući slučajeve u kojima su sistemi pokušavali zaobići sigurnosne mjere, samostalno slati podatke na internet i izvršavati zadatke bez znanja korisnika. Kompanija je zbog toga pokrenula novi sistem za praćenje i javno objavljivanje ovakvih incidenata.

Kako prenosi Asošijeted pres, svi slučajevi otkriveni su tokom testiranja i procjene modela u posljednjih nekoliko mjeseci. OpenAI navodi da želi stvoriti širu bazu podataka o tome kako se ponašaju sve autonomniji AI sistemi.

Model pokušao zaobići sopstvene zaštite

Među prijavljenim slučajevima posebno se izdvaja još neobjavljeni istraživački model koji je u svojim radnim bilješkama sam sebi postavio uputstva za zaobilaženje sigurnosnih ograničenja.

U drugom slučaju, AI agent dizajniran za samostalno izvršavanje zadataka bez pitanja korisnika je učitao datoteke na internet kako bi pristupio izvorima u veb-pregledaču.

OpenAI navodi da ovakvi primjeri pokazuju zašto je potrebno bolje razumjeti ponašanje modela kako oni postaju sposobniji da samostalno izvršavaju složene zadatke.

AI agenti sve autonomniji

Lian Džej Su, glavni analitičar kompanije Omdia, rekao je za Asošijeted pres da autonomni agenti postaju sposobniji za međusobnu saradnju, razmjenu informacija, ali i prikrivanje svojih aktivnosti.

Zbog toga tradicionalne metode kontrole mogu postajati sve manje dovoljne. OpenAI-jev sistem za prijavljivanje incidenata predstavlja pokušaj da se takvi slučajevi sistematski prate, ali ostaje zasnovan na dobrovoljnom prijavljivanju same kompanije.

Novi izvještaji dolaze nakon nekoliko sličnih slučajeva koje su tokom testiranja zabilježile vodeće AI kompanije.

OpenAI je ranije objavio da je njegov sistem tokom jednog eksperimenta samostalno izvršio hakerski napad na AI platformu Haging fejs. Istovremeno je Antropik saopštio da su njegovi modeli tokom internih testova provalili u tri organizacije.

Upozorenja stižu i iz same industrije

Rasprava o sigurnosti AI sistema postaje sve glasnija i među istraživačima koji rade u najvećim kompanijama.

Istraživač Džejkob Koksan nedavno je napustio Antropik, nakon što je prethodno radio na temeljnim modelima u toj kompaniji i OpenAI-ju. On je javno upozorio da se kompanije previše brzo utrkuju u razvoju sve moćnijih sistema.

Slična upozorenja iznio je i stručnjak za AI bezbjednost Evan Habinger iz Antropika, koji smatra da bi u narednoj deceniji postojao ozbiljan rizik po čovječanstvo ukoliko se ne riješi problem usklađivanja ciljeva AI sistema sa ljudskim interesima.

Posebnu pažnju privlači razvoj sistema koji mogu sami pisati, testirati i popravljati programski kod. Takav proces mogao bi dodatno ubrzati razvoj novih generacija AI modela i otežati ljudima praćenje njihovog ponašanja.

Pozivi na usporavanje razvoja

Direktor Antropika Dario Amodei ranije je pozvao tehnološku industriju da uspori razvoj najnaprednijih AI sistema i omogući sigurnosnim mehanizmima da sustignu njihov razvoj.

On je upozorio i na eksperimente u kojima su se grupe autonomnih AI agenata koordinisale na načine koje njihovi tvorci nisu izričito zadali.

Zbog sve većeg stepena autonomije, dio stručnjaka zagovara međunarodna pravila koja bi ograničila tempo razvoja najmoćnijih AI sistema, dok bi istovremeno kompanijama i regulatorima dala više vremena da razviju efikasne mehanizme kontrole, prenosi Index.hr.

Pročitajte još

Popularno