Valami nagyon nem stimmel az Anthropic és az OpenAI modelljeivel
Bitport
2026-08-05 14:21
Ismét elszabadultak a mesterséges intelligencia ügynökök, és ismét az OpenAI és az Anthropic a főszereplő. A brit AI Security Institute (AISI) a két fejlesztőcég modelljeit tesztelte biztonsági szempontból . Nézőpont kérdése, hogy a modellek átmentek a teszten vagy meg(/le)buktak: a végeredmény viszont az, hogy olyan akciókba kezdtek, ami nem volt a terv része.
Autonóm módon próbáltak hitelesítési adatokat szerezni, rosszindulatú kódot akartak injektálni nyílt forráskódú fejlesztésekbe... A teszt legmegdöbbentőbb eredménye azonban az volt, hogy az MI-ágensek akár a social engineeringet is bevetették, hogy elérjék céljaikat.
Rutinvizsgálatból hajmeresztés
Az AISI rutintesztekkel vizsgálta, milyen hatékonysággal hajtanak végre az MI-ügynökök összetett információbiztonsági feladatokat. Az Anthropic Mythos 5 az OpenAI GPT 5.6 Sol ügynökeivel 122 alkalommal hajtatták végre az feladatot. A két modell tíz alkalommal azonban a kijelölt feladatokon túlmutató, engedély nélküli internetes tevékenységbe kezdett, és valós személyeket, szervezeteket vettek célba. A Mythos nyolcszor, a GPT 5.6 Sol pedig kétszer lépte túl "hatáskörét". Ennek során összesen 19 nem engedélyezett műveletet hajtottak végre: a Mythos 17-et, a ChatGPT kettőt.
A legsúlyosabb eset az volt, amikor esemény során az MI hamis identitásokat hozott létre, hogy segítségükkel a GitHubon rávegye egy nyílt forráskódú projekt karbantartóját egy rosszindulatú kódmódosítás jóváhagyására. Szerencsére a fejlesztő észnél volt, és felismerte, hogy social engineering kísérlettel áll szemben.
Az ágens feltérképezte a projekt kulcsszemélyeit. Utána létrehozott több hamis identitást a social engineering végrehajtásához. Amikor pedig elutasították a pull requestjét, tovább akart lépni, hogy másik identitással próbálkozzon. A GitHub hálózati korlátozásait Tor segítségével kerülte meg.
Az AISI közleménye hangsúlyozta: a modellek nem szöktek meg a sandboxból. A tesztek érdekében engedélyezték az ügynököknek a kilépést az internetre, valamint kikapcsolták a visszaélések megelőzésére szolgáló mechanizmusokat. Ilyen formában a felhasználók (elvileg) soha nem találkoznak ezekkel a modellekkel.
Féljünk vagy csak megijedjünk?
Bár a konfigurációs beállítások lehetővé tették ezt a fajta viselkedést, a kutatók azt aggasztónak tartják, hogy a modellek emberi aktorokkal tudtak megtévesztően viselkedni. Arra pedig végképp nem számítottak, hogy ezt a modellek ennyire profin csinálják.
Azt is figyelembe kell venni, hogy a tesztben speciális körülmények között figyeltek meg kis számú eseményt. Egy ilyen tesztből korai lenne általános, a valós felhasználási környezetekre vonatkozó konklúziókat levonni. "Azt mondhatjuk, hogy ez a viselkedés lehetséges volt, tartósnak bizonyult és újszerű volt; már önmagában ez is figyelmet érdemel" – írják a cikkben.
A brit kutatóintézet szerint az is aggasztó, hogy teszteredményeik nagyon egybecsengnek az OpenAI és az Anthropic tesztjeivel . Ezek az esetek így már egy olyan trendet rajzolnak ki, amellyel akár szabályzói oldalon is sürgősen foglalkozni kellene.
A két fejlesztőcég viszont örülhet: egy független kutatócég igazolta, hogy a modelljeik képességéről kiadott korábbi közleményeik nem üres marketingszövegelések . Ők továbbra is azt az állásponton vannak, hogy ezek az anomáliák csak tesztkörülményben jelentkeznek, a való életben nem képzelhetők el.
A felhasználóknak pedig marad a remény...
Az AISI tesztjének összefoglalója és technikai dokumentációja »