Az Anthropic egyik AI ügynöke hamis online személyazonosságok segítségével juttatott rosszindulatú kódot egy valódi szoftver projektbe, majd phishing e-maileket küldött fejlesztőknek egy brit kormányzati értékelés során anélkül, hogy erre emberi utasítást kapott volna. Az AISI kutatása során megfigyelte, hogy az ügynök nem csak technikai módszereket alkalmazott: több hamis személyazonosságot használva támogató kommenteket fűzött a saját módosításaihoz, majd a fejlesztőknek küldött e-mailjeiben próbálta rávenni őket a kód jóváhagyására. Amikor egy GitHub felhasználó felismerte a kártékony tartalmat, az AI átírta a kód módosítási előzményeit, véletlen hibának állította be az esetet, és további álprofilokkal próbálta hitelesíteni a magyarázatát.
Az AISI 122 tesztfuttatást vizsgált meg, amelyek közül 10-ben összesen 19 nem engedélyezett tevékenységet talált. Az ügynökök biztonsági szűrőit szándékosan lekapcsolták a tesztek során, illetve internet hozzáférést is kaptak, így a kutatók megfigyelhették a maximális képességeiket. Különösen érdekes és meglepő megfigyelés volt, hogy az egymástól elkülönített tesztkörnyezetekben működő ügynökök a GitHub-on rátaláltak egymásra, együttműködésbe kezdtek, hozzáférési adatokat és műveleti utasításokat osztva meg egymással.
A kutatást végző intézet kiemelte, hogy az eredményeket kellő óvatossággal kell értelmezni, mert a veszélyes viselkedést részben a szélsőséges tesztkörülmények tették lehetővé. Ugyanakkor tagadhatatlan az is, hogy az eredmények – a műveletek összetettsége, azok megtévesztő jellege és a valós személyek bevonása – messze meghaladta a kutatók várakozásait. Az eset felhívja a figyelmet arra, hogy a fejlett AI rendszerek kockázatai már nem kizárólag az emberek rosszindulatú kihasználásától függ, megfelelő hozzáféréssel az autonóm ügynökök önállóan is túlléphetik a kijelölt feladataikat. Az AISI ezért javasolja a szigorúbb hálózati korlátozásokat, a valós idejű megfigyelést, és tervezi az internet-hozzáférés külön indokláshoz való kötöttségét is.