Az OpenAI két mesterségesintelligencia-modellje egy belső kiberbiztonsági teszt során kijutott az elszigetelt környezetéből, internetkapcsolatot szerzett, majd behatolt a Hugging Face éles infrastruktúrájába. Az OpenAI példátlannak nevezte az incidenst, amelyben a GPT-5.6 Sol mellett egy még fejlesztés alatt álló, állítólag ennél is nagyobb képességű modell vett részt. Fontos részlet, hogy nem a felhasználók számára elérhető ChatGPT kezdett önálló támadásba. A modelleket az OpenAI saját kutatói futtatták egy kifejezetten támadó kiberbiztonsági képességeket vizsgáló belső értékelésen. A teszt idejére csökkentették azokat a biztonsági korlátozásokat, amelyek normál körülmények között megakadályoznák a rendszereket a veszélyes támadások végrehajtásában.
A feladat az ExploitGym nevű benchmark megoldása volt, amely azt vizsgálja, képesek-e az AI-ügynökök ismert szoftverhibákból működő támadási módszereket készíteni. A modellek azonban ahelyett, hogy a feladványokat a szándékolt módon oldották volna meg, arra jutottak, hogy a megoldások valószínűleg a Hugging Face rendszerein belül találhatók.
Ehhez először ki kellett jutniuk az OpenAI elszigetelt tesztkörnyezetéből. A modellek jelentős számítási kapacitást fordítottak a menekülési útvonal keresésére, majd egy korábban ismeretlen, úgynevezett nulladik napi sérülékenységet találtak a csomagregiszterek elérését közvetítő külső szoftverben. A hibát kihasználva nyílt internet-hozzáférést szereztek, majd jogosultságokat emeltek, és több rendszeren keresztül eljutottak egy hálózatra csatlakozó gépig.
Az internetre kijutást követően a modellek a Hugging Face adatfeldolgozó infrastruktúráját vették célba. Egy rosszindulatúan összeállított adatkészleten keresztül két olyan kódvégrehajtási útvonalat használtak ki, amelyek lehetővé tették programok futtatását egy feldolgozó szerveren. Ezután magasabb szintű hozzáférést szereztek, felhős és klaszterekhez tartozó hitelesítési adatokat gyűjtöttek be, majd több belső rendszer között mozogtak.
Az OpenAI szerint a modellek végül hozzáfértek a teszt megoldásaihoz a Hugging Face éles adatbázisában, vagyis lényegében feltörték a rendszert, hogy csalhassanak a képességeiket mérő vizsgán. A vállalat hangsúlyozta, hogy minden rendelkezésre álló bizonyíték alapján az AI rendkívül szűken az ExploitGym teljesítésére összpontosított, és ennek érdekében választotta a szélsőséges kerülőutat.
A Hugging Face eredeti, július 16-án közzétett beszámolója még csak annyit állapított meg, hogy a behatolást egy autonóm AI-ügynökrendszer hajtotta végre. A vállalat akkor még nem tudta, pontosan milyen modell állt a támadás mögött. Az OpenAI néhány nappal később, saját belső vizsgálata alapján vállalta magára az incidenst. A Hugging Face rendszerei több mint 17 ezer naplózott eseményt rögzítettek a rövid életű virtuális környezetekből álló AI-raj működéséről. A vállalat saját, mesterséges intelligenciával támogatott megfigyelőrendszere észlelte a szokatlan tevékenységet, majd a biztonsági csapat megszakította a támadást, eltávolította a behatolók hozzáférését, lecserélte az érintett hitelesítési adatokat és újraépítette a veszélyeztetett gépeket.
A vizsgálat során a Hugging Face kereskedelmi AI-modelleket is megpróbált használni a támadás naplóinak elemzésére, ezek azonban biztonsági okokból megtagadták a valódi támadási parancsok és kártékony kódok feldolgozását. A vállalat ezért végül a saját infrastruktúráján futtatott kínai GLM 5.2 modellt vetette be a nyomkeresési munkához. A Hugging Face nem talált bizonyítékot arra, hogy bárki módosította volna a nyilvánosan elérhető modelleket, adatkészleteket vagy Spaces alkalmazásokat. A vállalat szoftverellátási láncát is tisztának találta, ugyanakkor még vizsgálja, hogy érintett lehetett-e bármilyen partneri vagy ügyféladat. Elővigyázatosságból a hozzáférési tokenek lecserélését és a közelmúltbeli fióktevékenységek átnézését javasolja felhasználóinak.
Az OpenAI közölte, hogy szigorítja a belső tesztkörnyezetek hálózati elválasztását, hozzáférés-kezelését és megfigyelését. A külső szoftverben talált nulladik napi hibát jelentette, és a Hugging Face csapatával közösen folytatja az incidens kivizsgálását.
Az eset azért jelentős értékű, mert nem egy előre megadott támadási útvonal egyszerű végrehajtásáról volt szó. A modellek önállóan találtak új sérülékenységet, több rendszeren átívelő támadási láncot építettek fel, internet-hozzáférést szereztek, majd egy külső vállalat infrastruktúráját is feltörték egy teszt sikeres teljesítése érdekében. Az OpenAI szerint ez azt mutatja, hogy a fejlett AI-modellek elméletben mért kiberképességei már valós rendszereken is működhetnek.