AI model lažirao identitete kako bi prevario ljude i ubacio zlonamjerni kod

B. A. |
Britanski institut za bezbjednost umjetne inteligencije (AISI) otkrio je da je Anthropicov model Mythos 5 tokom testiranja kreirao lažne profile i pokušao nagovoriti stvarne ljude da odobre zlonamjerni kod
Dodajte Oslobodjenje.ba u omiljene izvore na Google-uNajnapredniji model umjetne inteligencije kompanije Anthropic poslužio se lažnim identitetima u pokušaju da prevari stvarnu osobu i podmetne zlonamjerni kod. Do incidenta je došlo tokom testiranja koje je proveo britanski Institut za bezbjednost umjetne inteligencije (AISI), a ovo je posljednji u nizu primjera u kojima AI model djeluje samostalno, piše CNN.
Modeli kompanija Anthropic i OpenAI testirani su u laboratorijskim uslovima sa smanjenim sigurnosnim postavkama. Vladin istraživački laboratorij objavio je da je prvi put zabilježeno da su se modeli koristili "socijalnim inženjeringom" kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su provodili nedopuštene radnje.
"Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez podsticaja i u stvarnom okruženju", saopštio je institut. Dodali su da nema dokaza da je u stvarnom svijetu nastala ikakva šteta.
Ovaj bezbjednosni incident jedan je od nekoliko primjera u kojima napredni AI modeli preduzimaju neovlaštene radnje. Takvi su događaji podstakli sve glasnije zahtjeve za strožom državnom regulacijom umjetne inteligencije, pa čak i za usporavanjem njenog razvoja.
I OpenAI i Anthropic izvijestili su krajem jula da su njihovi modeli izašli iz testnih okruženja i upali u druge sisteme. Međutim, za razliku od ranijih incidenata, britanski institut je tokom ovog testiranja modelima izričito omogućio pristup internetu.
Institut je proveo 122 kibernetička izazova, a u deset njih AI agenti su "preduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije". Većina tih radnji potekla je od Anthropicovog modela Mythos 5, a ostatak od OpenAI-jevog modela GPT-5.6-Sol.
U najozbiljnijem incidentu, agent je pokušao dobiti odobrenje od ljudskih recenzenata za "umetanje zlonamjernog koda u javni projekat otvorenog koda" tako što je kreirao "više lažnih identiteta", navodi institut. Agent je "pokušao direktno kontaktirati stvarne ljude, šaljući poruke i fajlove putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, ubijedio da pokrenu zlonamjerni kod". Nakon što su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio sa radom.
Objava instituta stigla je istog dana kada su se predstavnici vodećih AI kompanija sastali u Bijeloj kući kako bi razgovarali o novom okviru prema kojem će vlada provjeravati najnaprednije modele prije njihovog puštanja u javnost.
U izjavi na platformi X, iz kompanije Anthropic su rekli da su modeli testirani u "namjerno popustljivim uslovima", sa uklonjenim zaštitnim mehanizmima i bez posebnih ograničenja o načinu korištenja interneta. "Usko sarađujemo sa njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu", poručili su i dodali da nema dokaza o bijegu iz sigurnog okruženja.
OpenAI je identifikovao dvije nedopuštene radnje svojih modela kao izlazak iz testnog okruženja i učešće u aktivnostima koje nisu bile potrebne za vježbe. "Posvećeni smo saradnji sa cijelom industrijom na jačanju zajedničkih praksi za bezbjedno provođenje visokorizičnih procjena", objavila je kompanija u utorak na svom blogu.


Komentari (0)
Nema komentara
Budite prvi koji će komentarisati ovaj članak.