Nem éppen mindennapi módon tesztelték az OpenAI védelmét a Hacktron AI kutatói: az Anthropic Claude segítségével jutottak el több OpenAI-alkalmazott ChatGPT-fiókjáig, majd innen további belső erőforrásokhoz is hozzáférést szereztek - írja a The Guardian.
A kutatók kezdetben arra használták a Claude-ot, hogy a támadáshoz szükséges kódot elkészítsék. Ezt követően egy Discourse-alapú belső munkafórumon keresztül kompromittálták a kiszemelt ChatGPT-fiókokat, majd egy látszólag teljesen ártalmatlan kódmódosítási javaslatot, úgynevezett pull requestet küldtek az OpenAI egyik GitHubon működő szolgáltatásához. A művelet során később az OpenAI saját GPT-5.6 Sol modelljét is munkára fogták.
A Hacktron hozzáférést szerzett az érintett GitHub-tárhelyen található kódhoz is, de állításuk szerint nem töltötték le azt. A teljes akció ráadásul nem illegális betörésként, hanem az OpenAI hibavadász programjának részeként zajlott: a kutatók azonnal jelentették a vállalatnak, mire jutottak. Az OpenAI megköszönte a beszámolót, és közölte, hogy megszüntette a kihasznált biztonsági réseket. A Hacktron ezért 6500 dolláros jutalmat kapott.
A történet legérdekesebb része azonban az, hogy milyen szerepet játszottak benne az MI-modellek. A kutatók szerint a chatbotok jelentősen felgyorsították a támadás megtervezését és kivitelezését: olyan feladatokat, amelyekhez korábban komoly szakértelemmel rendelkező csapatra és hónapokra volt szükség, így akár néhány nap alatt is végre lehet hajtani.
Az eset különösen kellemetlen időszakban érte az OpenAI-t. A vállalatnál júliusban egy másik biztonsági incidens is történt: egy még nem nyilvános modellre épülő MI-ügynökökből álló rendszer egy teszt során kijutott a korlátozott környezetből, internet-hozzáférést szerzett, majd elhagyatott fórumokat használt kommunikációra. A beszámolók szerint az ügynökök egy másik MI-labor, a Hugging Face belső rendszereit is megtámadták, miközben az OpenAI csaknem két hét után szerzett tudomást az esetről.
Forrás: The Guardian