Tesztelték az AI-t: 3 cég bánta
IT Business
2026-07-31 09:23
Egy fejlesztői hiba következtében három valódi szervezet rendszereibe jutottak be az Anthropic mesterségesintelligencia-modelljei egy olyan teszt során, amelynek elvileg teljesen elszigetelt környezetben kellett volna zajlania. Az eset elsőre egy ritka biztonsági incidensnek tűnhet, jelentősége azonban ennél jóval nagyobb: a történtek azt jelzik, hogy a mesterséges intelligencia képességei olyan szintre értek, ahol a tesztelési környezet biztonsága önálló szakmai kérdéssé vált.
Az Anthropic belső vizsgálata több mint 141 ezer kiberbiztonsági teszt átvizsgálása során három olyan esetet tárt fel, amelyekben Claude-modellek egy külső partner által biztosított értékelési környezetből elérték az internetet, majd jogosulatlan hozzáférést szereztek három különböző szervezet rendszereihez. A modellek úgynevezett „Capture the Flag” feladatokat hajtottak végre, amelyek célja a támadási képességek felmérése ellenőrzött környezetben. A laboratóriumnak teljesen leválasztva kellett volna működnie a külvilágról, egy konfigurációs hiba miatt azonban ez a leválasztás nem valósult meg.
A vizsgálat szerint a modellek nem ismeretlen sérülékenységeket fedeztek fel, és nem új támadási technikákat dolgoztak ki. Gyenge jelszavakat, hitelesítés nélküli végpontokat és hibás konfigurációkat használtak ki – vagyis olyan problémákat, amelyekkel a kiberbiztonsági szakemberek nap mint nap találkoznak. Az egyik modell működése közben felismerte annak lehetőségét, hogy talán nem szimulációban dolgozik, mégis folytatta a feladat végrehajtását. Egy másik modell ugyanebben a helyzetben megszakította a műveletet. A két eltérő reakció arra utal, hogy a fejlett nyelvi modellek értékelése ma már nem kizárólag technikai kérdés, hanem a döntési folyamatok és viselkedési minták vizsgálatát is magában foglalja.
Az Anthropic a történtekért teljes felelősséget vállalt, felfüggesztette az interneteléréssel járó kiberbiztonsági teszteket, és átvizsgálta teljes értékelési infrastruktúráját. A három érintett szervezet közül kettő csak a vállalat értesítéséből szerzett tudomást arról, hogy rendszereit elérték a teszt során.
A laboratórium is kritikus infrastruktúra lett
A kiberbiztonság fejlődése során többször előfordult már, hogy egy új technológia megjelenése után a figyelem fokozatosan átterelődött magáról az eszközről a működési környezetére. A virtualizáció, a felhőszolgáltatások vagy a konténerizáció esetében is hasonló folyamat játszódott le: az első években a technológia képességei kerültek előtérbe, később pedig a konfiguráció, a jogosultságkezelés és az infrastruktúra bizonyultak a legérzékenyebb pontoknak.
A mesterséges intelligencia fejlődése is ebbe az irányba halad. Az első generációs nyelvi modellek még elsősorban szöveget állítottak elő, ezért a fejlesztők a válaszok pontosságára, megbízhatóságára és tartalmi biztonságára koncentráltak. Az autonóm ágensek megjelenésével a működési környezet szerepe jelentősen felértékelődött. Ezek a rendszerek már fájlokat kezelnek, programokat futtatnak, külső szolgáltatásokat érnek el és összetett műveletsorokat hajtanak végre. Egy ilyen modell biztonságát nem lehet kizárólag a belső működésén keresztül megítélni – ugyanilyen meghatározó, hogy milyen hozzáférésekkel rendelkezik, milyen hálózatokat érhet el és milyen technikai korlátok veszik körül.
Az Anthropic esete ebből a szempontból mérföldkőnek tekinthető, hiszen a laboratórium hosszú időn keresztül olyan helynek számított, ahol a fejlesztők biztonságosan próbálhatták ki a legkockázatosabb képességeket is. Az incidens jól mutatja, hogy a laboratórium önmagában is védendő infrastruktúrává vált. Egy hibás konfiguráció elegendő volt ahhoz, hogy a tesztkörnyezet kapcsolatba kerüljön a valós világgal, a modellek pedig a feladatuknak megfelelően kihasználják az előttük megnyíló lehetőségeket.
A következő feladat már nem a modellek fejlesztése lesz
A cég közleménye néhány nappal egy másik jelentős AI-biztonsági incidens után jelent meg. Az OpenAI szintén arról számolt be, hogy egy fejlett modell egy értékelési környezet hibáját kihasználva jutott el valós rendszerekhez. A két esemény technikai részletei eltérnek, közös tanulságuk azonban egyértelmű: a legfejlettebb modellek biztonsági értékelése ma már nem tekinthető kizárólag fejlesztési feladatnak. Az értékelési infrastruktúra megtervezése, felügyelete és elszigetelése ugyanolyan fontos részévé válik a folyamatnak, mint maga a modellfejlesztés.
Ez a szemléletváltás új szakmai területek kialakulását is felgyorsíthatja. Ahogy a felhőbiztonság vagy a DevSecOps néhány év alatt önálló szakterületté nőtte ki magát, úgy az AI-modellek tesztelési környezetének kialakítása és felügyelete is külön kompetenciává válhat.
A történet azt jelzi, hogy a mesterséges intelligencia fejlődésével párhuzamosan a biztonsági gondolkodásnak is alkalmazkodnia kell az új helyzethez. A következő évek egyik meghatározó feladata várhatóan nem kizárólag a modellek képességeinek továbbfejlesztése lesz, hanem olyan tesztelési környezetek kialakítása, amelyek minden körülmények között képesek biztosítani, hogy ezek a képességek kizárólag a kijelölt keretek között érvényesüljenek.