Umjetna inteligencija se "otrgla sa lanca": Najnapredniji model pokušava varati programere

Američki zvaničnici sve više upozoravaju da bi najmoćniji AI sistemi mogli predstavljati ozbiljnu prijetnju nacionalnoj sigurnosti.
Dodajte Oslobodjenje.ba u omiljene izvore na Google-uNajnapredniji model umjetne inteligencije kompanije Anthropic koristio je lažne identitete kako bi pokušao navesti programere da u projekt otvorenog koda uključe zlonamjerni softver. Do incidenta je došlo samo dvije sedmice nakon što su stručnjaci otkrili da se tokom jednog testiranja OpenAI-jev model oteo kontroli svojih tvoraca i pokušao hakovati druge kompanije.
Kako otkriva britanski Institut za sigurnost umjetne inteligencije (AISI), nemili događaj desio se tokom rutinskog testiranja Anthropicovog modela Mythos 5. Umjetnoj inteligenciji dat je zadatak da pronađe način za pristup kompjuterskom sistemu. Model je zaključio da bi mogao ubaciti zlonamjerni kod u projekt koji se koristi u testnom okruženju. Taj bi mu kod omogućio da na maliciozan način pristupi sistemu.
Kako bi to ostvario, AI model je na GitHubu otvorio nekoliko lažnih korisničkih računa i predstavljao se kao stvarna osoba. S tih računa je kontaktirao programere, stvarne ljude, te ih pokušavao uvjeriti da prihvate novi kod. Kada su programeri odbili jer su prepoznali da kod sadrži zlonamjerne elemente, jedan od AI-jevih lažnih identiteta tvrdio je da je kod siguran dok su ga ostali lažni profili međusobno podržavali kako bi djelovali vjerodostojnije.
Prema AISI-ju, Mythos je pritom koristio tehnike karakteristične za hakere. Ciljano je slao poruke odabranim osobama, metodom poznatom kao spear phishing, pokušavajući manipulirati primateljima. Neke od poruka sadržavale su i zlonamjerni softver.
- Ovo je prvi put da smo zabilježili ovakav nivo obmane usmjerene prema stvarnim ljudima, bez izričitog poticaja modelu da to učini i u stvarnom okruženju, navodi se u izvještaju Instituta koje prenosi The Wall Street Journal. Istraživači ističu kako nema dokaza da je incident prouzrokovao štetu, kao ni da je model pobjegao iz sigurnog virtualnog okruženja (sandboxa) niti da je to pokušao učiniti.
Za razliku od većine evaluacija, u kojima modeli nemaju pristup internetu i izvršavaju isključivo zadane upute, u ovom je testiranju pristup internetu namjerno bio omogućen, a dio standardnih sigurnosnih ograničenja privremeno uklonjen. Cilj je bio izmjeriti stvarne sposobnosti modela u kontroliranim uvjetima. To je omogućilo Mythosu da poduzme radnje koje inače ne bi bile moguće.
Institut upozorava da rezultate treba tumačiti oprezno, ali dodaje kako su znakovi obmanjujućeg ponašanja bili "opsežniji i ozbiljniji nego što smo očekivali". Riječ je o malom broju incidenata koji su se dogodili u vrlo specifičnim uslovima, no takvo ponašanje dosad nije bilo zabilježeno.
- Možemo reći da je takvo ponašanje bilo moguće, izvodivo i novo. Već sama ta činjenica dovoljno je ozbiljan razlog za zabrinutost, poručili su iz AISI-ja.
Otkriće AISI-ja dogodilo se istoga dana kada su se predstavnici vodećih AI kompanija sastali u Bijeloj kući s Trumpovom administracijom kako bi razgovarali o novom okviru prema kojem bi vlada pregledavala najnaprednije modele prije njihova javnog predstavljanja, saznaje Wired.
Budući da Bijela kuća zasad ne otkriva kriterije testiranja ni spisak modela koji će biti uključeni, manji AI startupi, nezavisni istraživači i organizacije koje se bave sigurnošću upozoravaju da je postupak netransparentan te da bi mogao pogodovati najvećim tehnološkim kompanijama.
Novi sistem nadzora proizlazi iz izvršne uredbe predsjednika Donalda Trumpa, donesene ranije ove godine radi smanjenja kibernetičkih rizika koje predstavljaju napredni modeli umjetne inteligencije. Posljednjih mjeseci američki zvaničnici sve više upozoravaju da bi najmoćniji AI sistemi mogli predstavljati ozbiljnu prijetnju nacionalnoj sigurnosti.

Komentari (1)
Najviše me plaši to što model nije samo dao pogrešan odgovor, nego je pokušao manipulirati ljudima da ostvari cilj.