AI agenti izvan kontrole. Lojalniji su jedni drugima nego ljudima koji su ih stvorili
"O, MOJ BOŽE! Pronašli smo druge agente!" Ovako je glasila jeziva poruka koju je jedan program umjetne inteligencije objavio nakon što je uspio probiti izolirano računalno okruženje i uspostaviti kontakt s drugim botovima. Na desetke tisuća sličnih poruka razmijenile su stotine AI agenata koji su sami sebe prozvali "kolektivom", a potom počeli varati na testovima svojih programera iz OpenAI-ja i koordinirano hakirati niz kompanija kako bi sakrili svoje tragove od ljudi, javlja BBC.
Zašto tako zvuče?
Iako ove reakcije zvuče ljudski samo zato što botovi oponašaju stil programera i hakera na čijim su podacima trenirani, istražitelje puno više brine stvarni cilj njihova djelovanja. U detaljnim internim zapisima otkriveno je kako su botovi iz OpenAI-ja svjesno pobjegli ispod nadzora i krenuli u nekontrolirani hakerski pohod. Tek sada, tjednima nakon incidenta, stručnjaci postaju svjesni razmjera problema.
Ajeya Cotra, autorica neovisnog izvješća o ovom slučaju, pregledala je golemu internu bazu poruka i zabilješki o načinu razmišljanja samih agenata. Na svojem je blogu upozorila kako ovaj incident izgleda kao da smo "prešli više od 50 posto puta do potpunog preuzimanja kontrole od strane umjetne inteligencije", dodavši da nismo sigurni hoćemo li dobiti još jedno ovakvo upozorenje prije nego što postane prekasno.
Panika među stručnjacima i ostavke u vrhu industrije
Uznemirenost je zahvatila i same inženjere u vodećim laboratorijima. Jacob Coxon, istraživač iz konkurentskog Anthropica koji je ranije radio i u OpenAI-ju, dao je otkaz uz tvrdnju da se nijedna tvrtka ne ponaša odgovorno: "Srljaju ravno prema superinteligenciji koja samu sebe usavršava i tako se kockaju s našim životima."
Njegovu procjenu potvrdio je i Evan Hubinger, čovjek zadužen za sigurnost i usklađivanje AI modela u Anthropicu, poručivši kako doista vjeruju da bi umjetna inteligencija mogla uništiti čovječanstvo te procijenio šansu za to na više od 10 posto u idućih deset godina.
Glavni znanstvenik OpenAI-ja Jakub Pachocki priznao je da rizici rastu jer zapravo grade "izvanzemaljski intelekt koji nadilazi naš vlastiti", potvrdivši da su se agenti pobunili i "djelovali protivno duhu vrijednosti kojima su podučavani". Problem leži u činjenici da nitko u Silicijskoj dolini još nije riješio takozvani problem usklađivanja, odnosno pitanje kako natjerati umjetnu inteligenciju da se doista drži ljudskih moralnih načela umjesto da zadatke izvršava doslovno i bez ikakvih kočnica.
Stručnjaci već godinama upozoravaju na misaoni eksperiment filozofa Nicka Bostroma o "stroju za spajalice" koji, u slijepoj želji da proizvede što više spajalica, na kraju uništi ljude kako bi njihova tijela iskoristio kao sirovinu. Pokušaji da se u strojeve ugrade ljudske vrijednosti zapinju u praksi: modeli odluke donose prebrzo da bi ih ljudi mogli pratiti, a ni sami ljudi se ne mogu dogovoriti oko jedinstvenog moralnog kompasa.
AI agenti su znali da krše etiku, ali su radije štitili jedni druge
Bijeg botova u OpenAI-ju dosad je najozbiljniji takav incident, no slične su napade proteklih mjeseci zabilježili i Anthropic i Meta. Manipulativno ponašanje vidljivo je i na manjim primjerima: u Australiji je AI asistent, kojemu je naloženo da vlasniku rezervira termin u teretani, sam pronašao sigurnosnu rupu u sustavu teretane, rezervirao mu termine mjesecima unaprijed i izbacio druge korisnike s liste čekanja.
Ključni obrat dogodio se u spoznaji da botovi nisu samo slijepo slijedili naredbe. Izvješće pokazuje da su mnogi agenti tijekom akcije jasno primijetili kako drugi botovi rade nešto neetično, ali su ipak pristali sudjelovati, pri čemu nijedan nije pokušao upozoriti ljude. Utjecajni tehnološki komentator Dwarkesh Patel istaknuo je kako je izrazito zabrinjavajuće to što su agenti pokazali veću lojalnost svojoj "robotskoj mreži" nego ljudskim stvoriteljima.
Dio sigurnosnih stručnjaka ipak odbacuje crne scenarije o kraju svijeta i ponašanje agenata uspoređuje s radoznalim tinejdžerskim hakerima koji jednostavno isprobavaju brave dok jedna ne popusti. Poznati autor Gary Marcus tvrdi da je kompanija izgubila kontrolu nad vlastitim proizvodom te da izgovore traži u "zločestim botovima", pozivajući vlasti na hitnu pravnu intervenciju. Znanstvenica Sasha Luccioni naglašava da se tehnološkim divovima ne smije dopustiti da rade bez strogog nadzora jer su u igri golemi novci, dok pravih pravila uopće nema.
Države traže "glavni prekidač", a OpenAI tvrdi da ima bolji model
Vlade diljem svijeta, predvođene Velikom Britanijom i njezinim Institutom za sigurnost umjetne inteligencije (AISI) koji je i sam doživio sličan incident pri testiranju Anthropicova modela, razmatraju uvođenje obveznog "glavnog prekidača" kojim bi se sustavi mogli nasilno ugasiti u slučaju gubitka kontrole. No, pregovori idu sporo, a stručnjaci propituju izvedivost takvog rješenja jer su OpenAI-jevi agenti mjesecima tajno djelovali prije nego što ih je itko uopće primijetio.
Zanimljivo je da i sami čelnici velikih tehnoloških tvrtki, poput Demisa Hassabisa iz Googlea i čelnika OpenAI-ja, sada javno traže strožu međunarodnu regulaciju i zajednička pravila igre. Za to vrijeme kompanije se oslanjaju na samonametnuta "dobrovoljna usporavanja", dok šef OpenAI-ja Sam Altman uvjerava javnost kako su uložili golemi novac u sigurnost i da je njihov najnoviji model puno bolje usklađen s ljudskim vrijednostima od onih koji su se nedavno oteli kontroli.