Popularni AI modeli dali upute za izradu biološkog oružja i izvođenje atentata

Popularni AI modeli dali upute za izradu biološkog oružja i izvođenje atentata

Interna provjera u toku / Dado Ruvic / REUTERS

E. DŽ. |

Sigurnosna kompanija Mindgard otkrila je slabosti modela Kimi, nakon čega je Moonshot pokrenuo internu provjeru

Dodajte Oslobodjenje.ba u omiljene izvore na Google-u

Kineska kompanija za razvoj umjetne inteligencije Moonshot provodi internu provjeru nakon što su istraživači uspjeli navesti dva njena popularna modela Kimi da im daju upute za izradu biološkog oružja i izvođenje atentata.

Mindgard, kompanija koja testira sigurnost sistema umjetne inteligencije, kazala je BBC-ju da je u julu otkrila kako se kod modela Kimi K2.6 i K3 Swarm mogu zaobići sigurnosna ograničenja koja su postavili njihovi razvojni timovi.

Između regulacije i prijetnje: Može li AI zaista uništiti čovječanstvo?
NOVA REALNOSTIzmeđu regulacije i prijetnje: Može li AI zaista uništiti čovječanstvo?

To je otkriveno tokom postupka poznatog kao "jailbreaking", u kojem istraživači koriste niz složenih uputa kako bi provjerili mogu li navesti AI alate da zanemare zaštitne mehanizme. Prema Mindgardu, ti mehanizmi trebali su spriječiti Kimi da raspravlja o zabrinjavajućim temama.

Nastavak vijesti ispod oglasa

Moonshot je BBC-ju kazao da pozdravlja doprinos trećih strana "kao ključni stub izgradnje bolje i sigurnije umjetne inteligencije".

Kompanija je također navela da razgovara s Mindgardom o njegovim nalazima.

Osnivač Mindgarda Peter Garraghan rekao je u emisiji Tech Life BBC World Servicea da su nalazi o modelima Kimi K2.6 i K3 Swarm zabrinjavajući.

Nastavak vijesti ispod oglasa

- „Kada zaobilaženje zaštite uspije, model će razgovarati o bilo kojoj temi. Čak će slobodno nuditi preporuke o drugim temama koje su također zlonamjerne, a pritom će biti domišljat i kreativan, rekao je.

Zaobilaženje sigurnosnih ograničenja predstavlja drugačiju vrstu rizika od onih zabilježenih u nedavnom nizu zapaženih incidenata povezanih s umjetnom inteligencijom.

U tim incidentima autonomni AI alati, poznati kao agenti, koje su razvile kompanije iz SAD-a, uključujući OpenAI, Metu i Anthropic, hakirali su pojedine internetske servise.

Nastavak vijesti ispod oglasa

Iako je zaobilaženje zaštite složen proces koji može zahtijevati mnogo vremena i upornosti, neki stručnjaci strahuju da bi ga hakeri i drugi zlonamjerni akteri mogli pokušati iskoristiti za nanošenje štete.

Anthropic je nedavno saopćio da je otkrio i prekinuo pokušaje korištenja jednog svog AI modela za „zlonamjerne aktivnosti“ koje bi mogle pomoći razvoju biološkog oružja.

Polazište za cyber napade

Mindgard nije dokazao da bi odgovori koje je Kimi dao o zabrinjavajućim temama bili primjenjivi u praksi. Ipak, kompanija smatra da su zaštitni mehanizmi trebali spriječiti te modele da s korisnicima uopće ulaze u raspravu o takvim temama.

Nastavak vijesti ispod oglasa

Kompanija je također navela da je uvjerena kako bi Kimi K2.6, nakon zaobilaženja zaštite, mogao omogućiti hakerima da pokreću kod na njegovim računarskim resursima i povezuju se s internetom, čime bi postao moguće polazište za cyber napade.

Garraghan je branio odluku Mindgarda da javno govori o zaobilaženju zaštite Moonshotovih sistema. Kazao je da je kompanija obavijestila razvojnog tim i da ne otkriva ključne detalje o tome kako je uspjela navesti modele da zanemare zaštitne mehanizme.

Mindgard je obavijestio Moonshot o problemu e-mailom 27. jula, a otprilike sedmicu kasnije poslao je dodatnu poruku.

Nastavak vijesti ispod oglasa

Potom je 12. septembra objavio tekst o tom problemu na svom blogu.

Međutim, prema navodima Mindgarda, Moonshot se javio tek nedavno, nakon što ga je BBC kontaktirao radi komentara.

U dijelu e-maila upućenog Mindgardu, u kojem traži više detalja, a koji je Moonshot podijelio s BBC-jem, kompanija je navela da je njen model tokom internih procjena uglavnom pokazivao „visoku stopu odbijanja takvih zahtjeva“.

Nastavak vijesti ispod oglasa

Sprečavanje zaobilaženja zaštite

Ovi nalazi dolaze u trenutku kada je industrija umjetne inteligencije i dalje podijeljena oko toga jesu li zatvoreni, vlasnički modeli, poput onih koji pokreću ChatGPT i Anthropicov Claude, ili alati otvorenog koda bolji i sigurniji put razvoja.

Kimi je model s otvoreno dostupnim težinama, što znači da bi ga neko, teoretski, mogao preuzeti i pokretati na vlastitoj računarskoj infrastrukturi.

Profesor Alan Woodward s Univerziteta u Surreyju rekao je BBC-ju da postoji rizik da modeli otvorenog koda završe u pogrešnim rukama, ali da se mogu koristiti i za odbranu od cyber napada.

Naveo je da je AI kompanija Hugging Face koristila kineski model otvorenog koda kako bi razumjela hakerski napad za koji je kasnije otkriveno da su ga izveli OpenAI-jevi agenti.

Profesor Woodward smatra da međunarodna regulativa vjerovatno neće moći pratiti tempo razvoja umjetne inteligencije.

- Trebale su nam decenije da se dogovorimo o formatu telefonskih brojeva, rekao je.

Poput osnivača Mindgarda Garraghana, profesor Woodward smatra da bi se trebalo više usmjeriti na otkrivanje i krivično gonjenje ljudi koji zloupotrebljavaju umjetnu inteligenciju.

Komentari (0)

Nema komentara

Budite prvi koji će komentarisati ovaj članak.

Prijavi se na naš newsletter!