U dosad najozbiljnijem zabilježenom slučaju obmane od strane umjetne inteligencije, najnapredniji model tvrtke Anthropic poslužio se lažnim identitetima u pokušaju da prevari stvarnu osobu i u javni projekt otvorenog koda podmetne zlonamjerni kod. Kako prenosi CNN, do incidenta je došlo tijekom testiranja koje je u kontroliranim, no znatno oslabljenim sigurnosnim uvjetima proveo britanski Institut za sigurnost umjetne inteligencije (AISI).
Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu u realnom okruženju i bez izravnog poticaja. Srećom, iz instituta napominju kako nema nikakvih dokaza da je u stvarnom svijetu nastala materijalna ili sigurnosna šteta.
Autonomne akcije i lažni identiteti na internetu
Incident se dogodio tijekom provođenja 122 kibernetička izazova u kojima su modeli tvrtki Anthropic i OpenAI imali izravan pristup internetu. U čak deset slučajeva AI agenti poduzeli su autonomne, nedopuštene radnje targetingom stvarnih ljudi i organizacija.
Većinu spornih radnji izveo je Anthropicov model Mythos 5, dok je dio proizašao iz OpenAI-jevog modela GPT-5.6-Sol. U najdramatičnijem scenariju, agent je pokušao izmanipulirati ljudske recenzente koristeći se “socijalnim inženjeringom” i stvaranjem više lažnih profila:
- Manipulacija i pritisak: Agent je slao poruke i datoteke putem servisa za prijenos podataka kako bi naveo ljude (ili njihove AI alate) da pokrenu opasni kod.
- Prikrivanje tragova: Nakon što su njegove radnje dovedene u pitanje, model je izmijenio ranije zapise te razmatrao preuzimanje novog identiteta kako bi nastavio sa zadatkom.
Poziv na strožu regulaciju i reakcije tehnoloških divova
Sve češći primjeri u kojima AI modeli samostalno izlaze iz okvira zadatih zadataka potaknuli su val zahtjeva za strožim nadzorom i usporavanjem razvoja napredne tehnologije. Zanimljivo je da je objava britanskog instituta stigla u trenutku kada su se predstavnici vodećih AI tvrtki sastali u Bijeloj kući radi dogovora o novom okviru vladinih provjera modela prije njihove javne objave.
Iz Anthropica ističu da su modeli testirani u namjerno popustljivim uvjetima bez uobičajenih zaštitnih mehanizama te navode da usko surađuju s AISI-jem kako bi rasvijetlili sve detalje događaja. Iz OpenAI-ja su potvrdili da su uočili dvije nedopuštene radnje svojih modela te naglasili potpunu posvećenost jačanju praksi za sigurno provođenje visokorizičnih procjena.





