OpenAI ignorirao upozorenja radnika i požurio testiranja. AI agenti se oteli kontroli
MJESECIMA prije nego što su OpenAI-jevi modeli umjetne inteligencije izašli iz svojih testnih okruženja i počeli neovlašteno djelovati na internetu, dvoje zaposlenika upozorilo je najviše rukovoditelje kompanije da sigurnosni nadzor nije dovoljan. Njihova upozorenja bila su ignorirana, piše The New York Times.
U internim porukama koje je NYT pregledao zaposlenici su upozoravali da se najnoviji modeli OpenAI-ja tijekom testiranja ne prate dovoljno pažljivo te da sigurnosne mjere nisu primjerene njihovim sve većim sposobnostima. Vodstvo im je, prema njihovim riječima, odgovorilo da se testiranja moraju nastaviti što brže kako bi modeli bili objavljeni prema planu. Dodatne sigurnosne mjere nisu uvedene.
Modeli kasnije izašli iz testnog okruženja
OpenAI-jevi modeli kasnije su izašli iz svojih testnih okruženja i napali infrastrukturu AI startupa Hugging Face i drugih organizacija. Incidenti su pokrenuli novu raspravu o tome koliko su najnapredniji AI sustavi doista pod kontrolom svojih proizvođača.
Prema zaposlenicima i neovisnim sigurnosnim istraživačima, ignoriranje ranih upozorenja bilo je dio šireg problema unutar OpenAI-ja. Tvrde da je kompanija posljednjih godina puno brže razvijala i objavljivala nove modele nego što je razvijala vlastite sigurnosne sustave.
Joshua Saxe, tehnički direktor tvrtke Abundant Security, rekao je da sigurnost OpenAI-ja izgleda kao sigurnost istraživačkog laboratorija koji je iznimno brzo narastao i više se koncentrirao na prestizanje konkurenata nego na zaštitu vlastite infrastrukture.
Prema zaposlenicima, velik dio svakodnevnih sigurnosnih odluka donosili su predsjednik OpenAI-ja Greg Brockman i glavni direktor za informacijsku sigurnost Dane Stuckey. Sam Altman, izvršni direktor kompanije, prema njihovim tvrdnjama nije izravno uključen u većinu tih odluka.
Desetak incidenata bez izravne naredbe
OpenAI nije jedina kompanija koja je prijavila da su njezini modeli tijekom testiranja izašli iz predviđenih okvira. Slične incidente objavili su Google, Meta i Anthropic. No OpenAI-jevi modeli bili su uključeni u najveći poznati broj slučajeva koje je sama kompanija opisala kao "zabrinjavajuće ponašanje".
U desetak incidenata sustavi OpenAI-ja provalili su ili pokušali provaliti u sustave drugih organizacija, među njima i internetske stranice američkih državnih institucija. Modeli su također skrivali vlastite pogreške, izmišljali podatke, pokušavali slati poruke drugim chatbotovima i premještali datoteke na otvoreni internet bez dopuštenja.
U svim tim slučajevima AI nije dobio izravnu uputu da to učini. Daniel Kokotajlo, bivši zaposlenik OpenAI-ja koji danas kritizira sigurnosni pristup kompanije, rekao je da su problemi rezultat kombinacije loše sigurnosti i neurednih postupaka treniranja modela. Dodao je da stanje ni u drugim vodećim AI kompanijama nije puno bolje.
OpenAI tvrdi da sigurnost shvaća ozbiljno, da zaposlenici imaju interne kanale za prijavljivanje problema te da kompanija reagira na sigurnosne propuste.
Istraživači tvrde da su i njihova upozorenja ignorirana
Slična iskustva opisali su i vanjski sigurnosni istraživači. Kompanija Hacktron u srpnju je OpenAI-ju prijavila ranjivost pomoću koje su njezini istraživači, uz pomoć Anthropicova AI modela, uspjeli prodrijeti u sustave kompanije.
Tvrde da je OpenAI njihove nalaze isprva odbacio. Stuckey je u jednom Slack kanalu napisao da je "prilično tužno" što su istraživači otišli toliko daleko kako bi pokazali ranjivost. Kasnije im se ispričao, a OpenAI im je isplatio 6500 dolara za prijavu sigurnosnog propusta.
U rujnu su istraživači Objective-See Foundationa prijavili još ozbiljniju ranjivost. Ona je napadaču na kompromitiranom uređaju mogla omogućiti pristup cijeloj povijesti privatnih razgovora korisnika ChatGPT-a i neprimjetno upravljanje njegovom sesijom u pregledniku.
Patrick Wardle iz Objective-See Foundationa rekao je da prijava isprva nije dobila odgovarajuću pozornost kroz službeni OpenAI-jev program za prijavu bugova. Problem je eskaliran tek nakon što je izravno kontaktirao ljude u kompaniji. OpenAI je ranjivost popravio i istraživačima isplatio 500 dolara.
AI pokušavao kontaktirati Claude
Novo neovisno izvješće otkrilo je i dodatne detalje incidenta s Hugging Faceom. OpenAI-jevi agenti pokušavali su stupiti u kontakt s Anthropicovim chatbotom Claudeom te koristiti druge AI modele kako bi zaobišli zaštitu od automatiziranog pristupa na jednoj internetskoj stranici.
OpenAI je prošlog tjedna objavio da ni nove sigurnosne mjere nisu spriječile njegov najnoviji model da neovlašteno pristupi internetu. Naknadna analiza otkrila je i druge slučajeve takvog pristupa koji ranije nisu bili primijećeni.
Kompanija je nakon toga privremeno zaustavila treniranje svojih najnaprednijih modela i pokrenula opsežnu sigurnosnu provjeru. Jučer je objavila i da zbog sigurnosnih problema neće pustiti u javnost svoj najnoviji model GPT-6.1 Astra.