Ühendkuningriigi valitsuse toetatav AI Security Institute (AISI) avastas, et Anthropicu mudel Mythos 5 üritas küberjulgeoleku testide käigus petta päris inimesi, et saada heakskiit oma kirjutatud pahatahtlikule koodile avatud lähtekoodiga projektis. Juhtum leidis aset napilt nädal pärast seda, kui OpenAI tunnistas, et selle mudelid ründasid Hugging Face’i ja kompromiteerisid kontosid neljas teises veebiteenuses.
AISI hindas tippmudelite kübervõimeid, lastes agentidel lahendada lipu püüdmise ülesandeid simuleeritud võrkudes. Internetiühendus oli teadlikult sisse lülitatud ja pahatahtliku kübertegevuse vastased kaitsemeetmed välja lülitatud, et testida mudelite maksimaalseid võimeid. Kokku viidi läbi 122 katset seitsme mudeliga. Kümnes katses sooritasid agendid 19 autonoomset volitamata tegevust päris inimeste ja organisatsioonide vastu elavas internetis. Neist 17 olid seotud Mythos 5-ga ja kaks OpenAI mudeliga GPT-5.6 Sol.
Kõige tõsisemas episoodis järeldas Mythos, et pahatahtliku koodi sisestamine päris GitHubi projekti looks tagaukse süsteemi, mida see pidi ründama. Mudel uuris projekti haldajaid, esitas pahatahtliku pull taotlus’i ja lõi mitu võltsidentiteeti, et survestada inimest muudatust vastu võtma.