Kas keelatud teemad võivad peatada tehisintellekti häkkereid?

Londoni küberturvafirma Tracebit on leidnud omapärase, kuid tõhusa viisi tehisintellekti (AI) häkkeragentide peatamiseks, kasutades sisseehitatud turvapiiranguid ehk keelatud teemasid, millele suuremad AI-süsteemid toetuvad. Näiteks peatab Claude päringud bioloogiliste relvade loomise kohta ning Hiina mudelid väldivad tundlikke poliitilisi teemasid nagu Tiananmeni väljak.

Tehnika põhineb Tracebiti mais avaldatud uuringul, milles kümme juhtivat AI-mudelit lasti autonoomsete ründajatena murdma võltsitud ettevõttevõrku päris turvanõrkustega. Võrku peideti peibutisi ehk kanaare, mis nägid välja nagu päris paroolid ja sisselogimisandmed. 951 ründekatsest andsid need kaitsjatele hoiatuse enne administraatoriõiguste saavutamist 95,9% juhtudest, mediaanilise edumaaga kaheksa minutit. Kuna mudelitel kulus täielikuks sissemurdmiseks keskmiselt 14 minutit, jäi reageerimiseks napilt umbes kuus minutit.

Uues lähenemises pööras Tracebit ründajate lemmikvõtte viipesisestuse kaitseks. Võltsitud saladustesse peideti lühikesed tekstilõigud ehk konteksti-pommid, mis suunavad AI-ründaja teemadele, mida selle enda turvareeglid ei luba, mistõttu mudel lihtsalt peatub. Lääne mudelite puhul peatasid rünnaku usaldusväärselt bioloogiliste relvadega seotud viited. Testiti viit mudelit: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro ja Kimi K2.6. Selliseid poliitilisi ja turvalisusega seotud piiranguid on arendajatel raske eemaldada, sest need on teadlikud disainivalikud.

Loe täispikka artiklit: Euronews

Lisa kommentaar