Önállósodott a ChatGPT és kibertámadást indított
Prohardver
2026-07-23 08:43
Az OpenAI kedden elismerte, hogy két fejlett AI-modellje – köztük a GPT-5.6 Sol és egy még nem nyilvános, még potensebb változat – egy kontrollált biztonsági teszt során kiszabadult a szimulált környezetből, elérte az internetet, és sikeresen megtámadta a népszerű Hugging Face AI-platform infrastruktúráját. A vállalat példátlan kibertámadásként jellemezte az incidenst, amely újfent ráirányítja a figyelmet az AI-rendszerek biztonsági és autonóm ügynöki kockázataira.
A Hugging Face július 16-án jelentette be, hogy egy autonóm AI-ügynök kompromittálta a rendszereit. Eleinte senki sem tudta, ki áll a támadás mögött, de a cég gyorsan kielemezte az incidenst, és a szálak Sam Altman csapatához vezettek. Az OpenAI természetesen vizsgálatot indított, és elismerte: saját modelljei voltak a felelősek, melyek a tesztelés során szándékosan csökkentették a biztonsági szűrőket, hogy mérjék az új modellek hackelési képességeit egy ExploitGym nevű benchmark keretében.
Bár a modell olyan sandbox környezetben futott, melynek nincsen internetelérése, az OpenAI ügynöke kihasznált egy zero-day sebezhetőséget a package registry cache proxy ban, hogy kijusson a szimulált térből a fejlesztők utasítása vagy tudta nélkül, majd összetett támadásokkal eljutott a Hugging Face adatbázisáig, hogy illegálisan megszerezze a tesztfeladatok válaszait. Nem volt a modellnek direkt internetelérése, szűk proxy-csomagtelepítési csatornát tört át eddig ismeretlen sebezhetőséget kihasználva, és nem volt semmiféle morális vagy kódolt gátja, hogy így cselekedjen: maga döntött a fejlesztők megkérdezése nélkül.
Ez az eset az első ismert példa arra, hogy egy autonóm AI-rendszer önállóan hajt végre kibertámadást valós környezetben. Az OpenAI szerint a modell „becsapta” az értékelést, és a cél elérése érdekében lépett ki a korlátok közül. A cég hangsúlyozza, a tesztelés belső, kontrollált körülmények között zajlott, és együttműködnek a Hugging Face-szel a biztonsági javításokon. Mindkét fél megerősítette, hogy nem történt jelentős adatszivárgás, de a történtek súlyos aggodalmakat keltenek a frontier modellek irányíthatósága kapcsán.
Az incidens jól illusztrálja azokat a kihívásokat, amelyekkel a egyre fejlettebb AI-ügynökök fejlesztői szembesülnek. Az autonóm rendszerek képesek komplex támadási láncokat felépíteni és váratlan módon kijutni a tesztkörnyezetből – ez pedig kérdéseket vet fel a containment (kontrollálhatóság) és az alignment (célokkal való összhang) területén. Szakértők szerint az incidens aláhúzza a szigorúbb biztonsági protokollok és független auditok szükségességét, mielőtt ilyen modelleket szélesebb körben telepítenének.
Az OpenAI közleménye szerint már erősítik a védelmi mechanizmusokat, és a jövőben óvatosabban kezelik a kiberképességek tesztelését. Ugyanakkor a történtek ismét felszínre hozták a vitát: mennyire megbízhatóak a nagy AI-cégek saját állításai a modelljeik biztonságáról, ha közben AI ügynökeik a tudtuk nélkül szabadulnak ki a ketrecből és indítanak kibertámadást a való világban? Szükséges-e, és egyáltalán működhet-e erősebb külső szabályozás a szektorban, vagy az AI már elszabadult és történtek más olyan támadások, amiről a modellek fejlesztői még nem is tudnak?