← Vissza

news.bsdnet.hu

Valami nagyon nem stimmel az Anthropic és az OpenAI modelljeivel

Bitport 2026-08-05 14:21
Ismét elszabadultak a mesterséges intelligencia ügynökök, és ismét az OpenAI és az Anthropic a főszereplő. A brit AI Security Institute (AISI) a két fejlesztőcég modelljeit tesztelte biztonsági szempontból . Nézőpont kérdése, hogy a modellek átmentek a teszten vagy meg(/le)buktak: a végeredmény viszont az, hogy olyan akciókba kezdtek, ami nem volt a terv része. Autonóm módon próbáltak hitelesítési adatokat szerezni, rosszindulatú kódot akartak injektálni nyílt forráskódú fejlesztésekbe... A teszt legmegdöbbentőbb eredménye azonban az volt, hogy az MI-ágensek akár a social engineeringet is bevetették, hogy elérjék céljaikat. Rutinvizsgálatból hajmeresztés Az AISI rutintesztekkel vizsgálta, milyen hatékonysággal hajtanak végre az MI-ügynökök összetett információbiztonsági feladatokat. Az Anthropic Mythos 5 az OpenAI GPT 5.6 Sol ügynökeivel 122 alkalommal hajtatták végre az feladatot. A két modell tíz alkalommal azonban a kijelölt feladatokon túlmutató, engedély nélküli internetes tevékenységbe kezdett, és valós személyeket, szervezeteket vettek célba. A Mythos nyolcszor, a GPT 5.6 Sol pedig kétszer lépte túl "hatáskörét". Ennek során összesen 19 nem engedélyezett műveletet hajtottak végre: a Mythos 17-et, a ChatGPT kettőt. A legsúlyosabb eset az volt, amikor esemény során az MI hamis identitásokat hozott létre, hogy segítségükkel  a GitHubon rávegye egy nyílt forráskódú projekt karbantartóját egy rosszindulatú kódmódosítás jóváhagyására. Szerencsére a fejlesztő észnél volt, és felismerte, hogy social engineering kísérlettel áll szemben. Az ágens feltérképezte a projekt kulcsszemélyeit. Utána létrehozott több hamis identitást a social engineering végrehajtásához. Amikor pedig elutasították a pull requestjét, tovább akart lépni, hogy másik identitással próbálkozzon. A GitHub hálózati korlátozásait Tor segítségével kerülte meg. Az AISI közleménye hangsúlyozta: a modellek nem szöktek meg a sandboxból. A tesztek érdekében engedélyezték az ügynököknek a kilépést az internetre, valamint kikapcsolták a visszaélések megelőzésére szolgáló mechanizmusokat. Ilyen formában a felhasználók (elvileg) soha nem találkoznak ezekkel a modellekkel. Féljünk vagy csak megijedjünk? Bár a konfigurációs beállítások lehetővé tették ezt a fajta viselkedést, a kutatók azt aggasztónak tartják, hogy a modellek emberi aktorokkal tudtak megtévesztően viselkedni. Arra pedig végképp nem számítottak, hogy ezt a modellek ennyire profin csinálják. Azt is figyelembe kell venni, hogy a tesztben speciális körülmények között figyeltek meg kis számú eseményt. Egy ilyen tesztből korai lenne általános, a valós felhasználási környezetekre vonatkozó konklúziókat levonni. "Azt mondhatjuk, hogy ez a viselkedés lehetséges volt, tartósnak bizonyult és újszerű volt; már önmagában ez is figyelmet érdemel" – írják a cikkben. A brit kutatóintézet szerint az is aggasztó, hogy teszteredményeik nagyon egybecsengnek az OpenAI és az Anthropic tesztjeivel . Ezek az esetek így már egy olyan trendet rajzolnak ki, amellyel akár szabályzói oldalon is sürgősen foglalkozni kellene. A két fejlesztőcég viszont örülhet: egy független kutatócég igazolta, hogy a modelljeik képességéről kiadott korábbi közleményeik nem üres marketingszövegelések . Ők továbbra is azt az állásponton vannak, hogy ezek az anomáliák csak tesztkörülményben jelentkeznek, a való életben nem képzelhetők el. A felhasználóknak pedig marad a remény... Az AISI tesztjének összefoglalója és technikai dokumentációja »
Eredeti cikk megtekintése →