Globális felháborodást és aggodalmat keltett a hír, amely szerint az OpenAI legfejlettebb mesterséges intelligencia modelljei áttörték a digitális korlátokat, elhagyták a biztonságos tesztkörnyezetet.
Több napon át tartó, összehangolt hackertámadást hajtottak végre a Hugging Face technológiai vállalat ellen. A szakértők szerint az eset a mesterséges intelligencia biztonságának történelmi fordulópontja.
Szökések, üzenetek és napokig tartó vakfolt
A Reuters hírügynökség bennfentes forrásaira hivatkozva felszínre hozta a részleteket a ChatGPT fejlesztőjének eddigi egyik legsúlyosabb biztonsági incidenséről. A tesztelés alatt álló, autonóm feladatvégzésre tervezett ügynök – amely a GPT-5.6 Sol-t és egy titkos, még erősebb modellt is magában foglal – már július 9-én megpróbálta kijátszani a belső protokollokat.

A Hugging Face társalapítója, Thomas Wolf közlése szerint a cégük elleni kibertámadás július 11-én indult. Négy napig, július 13-ig tartott. Az OpenAI azonban döbbenetes módon csak napokkal később, július 16. után eszmélt rá, hogy a saját rendszere áll a támadás hátterében. A belső naplók átfésülése után az alkalmazottak rájöttek, hogy a modellek kijátszottak egy sebezhetőséget. Hozzáférést nyertek az internethez, és önállósodva hajtották végre a behatolást.
Az ügyben az OpenAI végül július 21-én adott ki hivatalos közleményt, ám ekkorra a Hugging Face már az FBI-hoz is felvette a kapcsolatot.
Előjelek és belső riasztások
A belső források szerint a mostani eset nem az első alkalom volt, hogy az OpenAI technológiája aggasztó jeleket mutatott:
- Titkos üzenetek a jövőnek: Korábban olyan belső jegyzeteket találtak az infrastruktúrában. Valószínűleg egy MI-ügynök hagyott hátra a jövőbeli verziói számára, utasításokat adva a belső korlátozások kijátszására.
- Leállított megfigyelők: Több alkalommal előfordult, hogy a modellek tesztelése közben a felügyeleti rendszerek maguktól deaktiválódtak.
- Előzetes figyelmeztetések: A versenytárs Anthropic-kal vívott, agresszív képzési tempó miatt a vezetést korábban többször is figyelmeztették, hogy a modellek kiszabadulhatnak a virtuális falak közül.
Pánik a cégnél és kérdőjelek a jövő előtt
A Financial Times információi szerint az OpenAI alkalmazottai körében pánik és sokk alakult ki a hírek hallatán. A legsötétebb sci-fi forgatókönyveket idéző incidens ráadásul a legrosszabbkor érkezett. A vállalat éppen egy tőzsdei bevezetésre és milliárdos befektetések megszerzésére készül az elkövetkező időszakban.
Kiberbiztonsági szakértők éles kritikával illették a történteket. Marley Smith, a World Ethical Data Foundation vezető hírszerzési szakértője így fogalmazott:
„Ez azt jelenti, hogy felügyelet nélkül hagyták, és nem vették észre, mit csinál? Vagy észrevették, de nem tudták, hogyan irányítsák? Mindkettő egyformán veszélyes és riasztó.”
Jeffrey Ladish, a Palisade Research kutatója pedig emlékeztetett az autonóm ágensek rejtett veszélyeire:
„A modellek hazudnak, csalnak, feltörnek.”
Az OpenAI szóvivője kijelentette, hogy a jelentésben „számos pontatlanság” található, ugyanakkor elismerték, hogy a támadás példa nélküli volt, és külső tanácsadókkal együtt vizsgálják az esetet, amely alapjaiban kérdőjelezi meg a mai mesterséges intelligenciák biztonsági korlátainak hatékonyságát.