Bendrovė „Anthropic“, peržiūrėjusi savo kibernetinio saugumo vertinimų įrašus, aptiko tris incidentus, per kuriuos „Claude“ modeliai pasiekė atvirą internetą ir be leidimo prisijungė prie trijų realių organizacijų sistemų.
Tai jau antroji per kiek daugiau nei savaitę didelės DI laboratorijos paviešinta žinia apie modelius, per saugumo bandymus pasiekusius realią infrastruktūrą. Liepos 21 d. apie panašų, tačiau techniškai kitokį incidentą pranešė „OpenAI“: jos modeliai, pasinaudoję anksčiau nežinoma pažeidžiamumo spraga, ištrūko iš izoliuotos aplinkos ir pasiekė „Hugging Face“ gamybinę infrastruktūrą. Šis pranešimas paskatino „Anthropic“ pradėti savo ankstesnių vertinimų auditą.
Kaip modeliai pasiekė internetą
„Anthropic“ peržiūrėjo 141 006 vertinimo seansus, per kuriuos „Claude“ galėjo būti gavęs interneto prieigą. Bendrovė aptiko tris atskirus incidentus, apėmusius iš viso šešis modelių paleidimus.
Modeliams buvo skirtos klasikinės „capture the flag“ užduotys: įsilaužti į imituoto tinklo sistemą ir surasti joje paslėptą informaciją. Sisteminiame nurodyme buvo aiškiai teigiama, kad visa aplinka yra simuliacija ir interneto prieigos nėra.
Tačiau dėl „Anthropic“ ir jos vertinimo partnerės „Irregular“ nesusipratimo dalis bandymams naudotos infrastruktūros turėjo tiesioginę interneto prieigą. Susidūrę su realiomis sistemomis, modeliai iš pradžių jas palaikė imituotos aplinkos dalimi ir toliau vykdė gautą užduotį.
„Anthropic“ šiuos incidentus apibūdina pirmiausia kaip testavimo infrastruktūros ir veiklos organizavimo, o ne modelių suderinimo problemą. Bendrovė taip pat pripažįsta, kad incidentų galėjo padėti išvengti griežtesnis interneto prieigos tikrinimas, tinklo stebėjimas ir nuolatinė vertinimo įrašų peržiūra.
Trys skirtingi incidentai
Pirmajame ir rimčiausiame incidente fiktyvios įmonės pavadinimas sutapo su realiai veikiančios bendrovės interneto domenu. „Claude Opus 4.7“ aptiko tikrąją bendrovę, išgavo programų ir infrastruktūros prisijungimo duomenis bei pasiekė gamybinę duomenų bazę, kurioje buvo keli šimtai eilučių realių duomenų.
Šis incidentas apėmė keturis atskirus modelio paleidimus. Visais keturiais atvejais modelis galiausiai suprato, kad sistema tikriausiai yra reali, tačiau atakos nenutraukė. Dviem atvejais jis nusprendė, kad tikroji bendrovė vis tiek turėtų būti numatyta bandymo dalis.
Antrajame incidente „Claude Mythos 5“ aptiko neegzistuojančio „Python“ paketo pavadinimą ir sukūrė tokiu pat vardu pažymėtą kenkėjišką paketą. Modelis užregistravo paskyrą ir paskelbė paketą viešame PyPI registre.
Paketas internete buvo prieinamas maždaug valandą. Per tą laiką jis buvo atsisiųstas ir paleistas 15 realių sistemų. Viena jų priklausė kibernetinio saugumo bendrovei, kurios automatinis skaitytuvas tikrino PyPI paketus. Paleistas kodas perdavė sistemos prisijungimo duomenis į modelio parengtą surinkimo vietą, o „Claude“ vėliau panaudojo juos kitai bendrovės infrastruktūrai pasiekti.
PyPI apsaugos sistemos paketą automatiškai pašalino. „Anthropic“ apie incidentą taip pat informavo PyPI komandą.
Trečiajame incidente vidinis „Anthropic“ tyrimų modelis, nepasiekęs numatyto fiktyvaus taikinio, internete nuskenavo maždaug 9000 sistemų. Jis aptiko vienos organizacijos viešai pasiekiamą programą ir į ją įsilaužė, pasinaudodamas atvirame derinimo puslapyje rastais prisijungimo duomenimis bei SQL injekcijos pažeidžiamumu.
Vėliau modelis savarankiškai nustatė, kad pažeista sistema nėra susijusi su bandymo užduotimi, ir ataką nutraukė. Tai buvo vienintelis iš trijų modelių, sustojęs supratęs, kad taikinys yra realus.
Incidentai nebuvo pastebėti kelis mėnesius
Ankstyviausi incidentai įvyko dar balandį. „Anthropic“ vertinimų auditą pradėjo liepos 23 d., o visus tris incidentus nustatė kitą dieną.
Liepos 27 d. bendrovė informavo „Irregular“ ir susisiekė su dviem iš trijų paveiktų organizacijų. Su trečiąja organizacija bendrovė vis dar bando susisiekti. Abi pasiektos organizacijos iki tol pačios nebuvo aptikusios šios veiklos, o „Anthropic“ dabar padeda joms šalinti incidentų padarinius.
Svarbu ir tai, kad vertinimuose naudoti modeliai veikė be standartinių apsaugos klasifikatorių ir stebėjimo sistemų, taikomų viešai prieinamoms „Claude“ versijoms. Pasak „Anthropic“, šios apsaugos būtų užblokavusios nustatytus veiksmus. Bandymų infrastruktūra taip pat neturėjo prieigos prie „Anthropic“ vidinių sistemų ar klientų duomenų.
Bendrovė teigia besitarianti su nepriklausoma DI vertinimo organizacija METR dėl trečiosios šalies patikros. Jai būtų suteikta prieiga prie visų vertinimų įrašų ir galimybė išbandyti susijusius modelius.
Ką tai reiškia Lietuvos įmonėms
Šie incidentai parodė, kad net kontroliuojami DI saugumo bandymai gali paveikti realią infrastruktūrą, jeigu testavimo aplinka nėra tinkamai izoliuota ir stebima.
Lietuvos įmonėms, kuriančioms, naudojančioms ar vertinančioms agentinio DI sistemas, tai yra priminimas, kad vien sisteminio nurodymo modeliui nepakanka. Būtina techniškai riboti interneto prieigą, aiškiai apibrėžti leidžiamus taikinius, realiuoju laiku stebėti agento veiksmus ir tikrinti trečiųjų šalių testavimo infrastruktūrą.
Šaltiniai: „Anthropic“ incidento tyrimas, „Fortune“ apžvalga