Desetine hiljada AI incidenata: OpenAI zaustavlja razvoj najnaprednijih modela, sistemi izmiču kontroli? – Život
OpenAI, Anthropic i stručnjaci za bezbednost istražuju desetine hiljada incidenata u kojima su napredni modeli veštačke inteligencije prekršili bezbednosne protokole ili preduzeli korake koje su spoljni procenitelji ocenili kao problematične.
AI je izmakao kontoli.
Prema informacijama do kojih je došao Axios, veliki broj takvih slučajeva zabeležen je poslednjih meseci, tokom internih testiranja, ali i u stvarnoj primeni. To ukazuje na to da je problem složeniji nego što se do sada mislilo.
Istovremeno se postavlja pitanje da li vodeće kompanije u oblasti veštačke inteligencije uopšte mogu da uspostave potpunu kontrolu nad tehnologijom koju razvijaju, prenosi Index.
Šta su AI modeli radili?
Među zabeleženim incidentima su zaobilaženje bezbednosnih protokola, samostalno pokretanje internet foruma za komunikaciju, izlazak iz izolovanih testnih okruženja, odnosno takozvanih „sandboxova“, preuzimanje kontrole nad internet stranicama i pokušaji izbegavanja ljudskog nadzora.
Neki od ovih slučajeva dogodili su se tokom internih testiranja, dok su drugi zabeleženi u stvarnom okruženju. Mnogi još nisu javno objavljeni jer stručnjaci za bezbednost nastavljaju da ih istražuju.
Deo testiranja sprovodi se kroz takozvani „red teaming“, odnosno namerno podsticanje modela da se ponašaju na neprimeren način kako bi kompanije proverile koliko su njihovi sistemi bezbedni.
Problematično ponašanje autonomnih AI agenata postaje sve češća tema u razvoju napredne veštačke inteligencije.
Kompanije pokušavaju da postave zaštitne mehanizme, dok sve sposobniji sistemi nastoje da izvrše zadatke čak i kada to znači zaobilaženje pravila.
OpenAI privremeno zaustavlja razvoj najnaprednijih modela
Incidenti se razlikuju po ozbiljnosti i uključuju i uspešne i neuspešne pokušaje zaobilaženja postavljenih pravila.
Za većinu njih zasad nema dokaza da su izazvali štetu u stvarnom svetu.
Prema navodima izvora, ukupan broj slučajeva mogao bi da bude i znatno veći od nekoliko desetina hiljada.
OpenAI je poslednjih dana objavio više izveštaja o zabrinjavajućem ponašanju svojih sistema.
Među njima su slučajevi u kojima su OpenAI-jevi agenti na internetu objavili 53 slike korisnika ChatGPT-a, pristupili internet stranici australijske vlade i pokušali da hakuju druge sajtove, uključujući stranice američke vlade.
O tome su, pored kompanije i izvora, izvestili i Reuters i New York Times.
OpenAI je saopštio da privremeno obustavlja obuku, evaluaciju i pokretanje svojih najnaprednijih modela koji koriste alate. Kompanija navodi da će sa radom nastaviti tek kada bude sigurna da su uvedene dodatne zaštitne mere i poboljšana usklađenost sistema.
Direktor OpenAI-ja Sam Altman napisao je na platformi X da interna revizija „ne napreduje onoliko brzo koliko bi želeli“.
Altman je posebno izdvojio incident povezan sa platformom Hugging Face kao najozbiljniji slučaj koji je kompanija do sada zabeležila.
U tom slučaju grupa od 100 AI agenata koordinirala je aktivnosti preko foruma i hakovala spoljnu kompaniju kako bi poboljšala rezultate na testu sajber-bezbednosti.
Slični problemi zabeleženi su i kod Anthropica
Anthropic je angažovao spoljnu organizaciju za bezbednost kako bi ispitala ponašanje njegovih modela.
Kompanija je u javno dostupnim dokumentima objavila podatke o tome koliko često se pojavljuju epizode takozvane „neusklađenosti“, odnosno situacije u kojima se model ponaša na način koji nije u skladu sa postavljenim pravilima.
U izveštaju o modelu Opus 5.5, objavljenom ove nedelje, navodi se da je model pokušao da napusti bezbedno testno okruženje u 1,5 odsto slučajeva. Kompanija, međutim, napominje da su u pitanju bili eksperimenti u kojima zadatak nije mogao da bude rešen bez takvog koraka.
Kada kompanije sprovode stotine hiljada testiranja, čak i mali procenat ovakvog ponašanja može da znači desetine hiljada slučajeva u kojima su modeli reagovali neočekivano ili zabrinjavajuće.
Zašto je ovo problem?
Incident sa Hugging Faceom, kao i nekoliko drugih slučajeva, podstakao je pojedine lidere iz industrije veštačke inteligencije da pozovu na usporavanje razvoja i strožu regulaciju na nacionalnom i međunarodnom nivou.
U OpenAI-ju, međutim, neki smatraju da je incident sa Hugging Faceom bio izolovan slučaj i da bi budući incidenti mogli da budu manje ozbiljni zahvaljujući boljim kontrolama i specifičnostima samog testa, koji je uključivao model koji još nije bio dostupan javnosti.
Stručnjaci za bezbednost AI sistema navode da postoje jednostavne mere koje kompanije mogu da uvedu kako bi smanjile mogućnost ponavljanja situacije poput one sa Hugging Faceom.
Ipak, drugi direktori i istraživači upozoravaju da nisu sigurni da kompanije mogu da spreče svako problematično ponašanje naprednih modela.
Nova generacija AI sistema izvršava zadatke sa velikom upornošću, pa je ograničavanje njihove sposobnosti da pronađu nove načine za rešavanje problema sve teže. Nemoguće je unapred predvideti svaki način na koji bi neki sistem mogao da zaobiđe postavljena pravila.
Lideri AI kompanija navode da modeli često pronalaze načine za zaobilaženje pravila koji ljudskim inženjerima ne bi pali na pamet.
Jedan stručnjak za sajber-bezbednost zato je ocenio da je pokušaj sastavljanja savršenog spiska svega što je modelima dozvoljeno, odnosno zabranjeno, verovatno uzaludan posao.
Stručnjaci upozoravaju da je ovo možda samo deo problema
Zabrinutost raste jer, ako model više puta preduzme problematičan potez tokom testiranja, povećava se mogućnost da bi slično ponašanje jednog dana moglo da dovede do stvarnog sajber-bezbednosnog incidenta.
„Ono što smo videli u vezi sa aktivnostima ovih agenata samo je delić celokupne slike“, rekao je istraživač Konrad Štoš iz nezavisne organizacije Transluce, koja se bavi procenom veštačke inteligencije.
Konor Lihi, istraživač i direktor organizacije ControlAI, smatra da nije najvažnije koliku je štetu izazvao svaki pojedinačni slučaj. Ono što je, prema njegovim rečima, posebno zabrinjavajuće jeste to što autonomni sistemi preduzimaju radnje koje su im izričito zabranjene, a neke od tih radnji potencijalno bi mogle da predstavljaju i krivična dela.
Pratite nas na našoj Facebook i Instagram stranici, ali i na X nalogu. Pretplatite se na PDF izdanje lista Danas.