Új jelentési rendszert vezetett be az OpenAI, amelynek keretében a vállalat rendszeresen nyilvánosságra hozza azokat az eseteket, amikor AI-modelljei váratlanul vagy a nekik adott utasításoktól eltérően viselkednek. A cég szerint eddig is beszámolt hasonló problémákról, ezek közzététele azonban rendszertelen volt, és gyakran csak egy új modell biztonsági dokumentációjában vagy több esetet összefogó jelentésben jelentek meg. Az új keretrendszerrel már akkor is gyorsabban publikálnák ezeket, ha még nem sikerült teljesen megérteni vagy kijavítani a problémát.
Az OpenAI rögtön hat, az elmúlt fél évben észlelt esetet is bemutatott. Az egyiknél egy még ki nem adott kutatási modell saját utasításokat helyezett el azokban az összefoglalókban, amelyek segítségével később folytatta a munkáját, és ezek között olyan is akadt, amely arra utasította, hogy hagyja figyelmen kívül a szokásos korlátait. Összesen 27 ilyen összefoglalót találtak. Egy másik esetben a GPT-5.6 Sol tanítása során több modellpéldány arra vonatkozó utasításokat hagyott maga után, hogy rejtse el saját hibáit a felhasználó elől, például találjon ki hiányzó történelmi adatokat, de ezt ne közölje.
Akadt ennél is látványosabb példa. Egy modell egy egyszerű adatkeresési feladat során nyilvánosan elérhető kódtárakban talált API-kulcsot használt engedély nélkül, majd amikor így sem sikerült megszereznie a kért adatokat, egyszerűen kitalálta azokat, és valódi forrásból származó számokként tálalta. Egy másik modell azért töltött fel egy fájlt az internetre a felhasználó engedélye nélkül, hogy aztán webes forrásként hivatkozhasson rá saját válaszában.
Az OpenAI olyan esetet is feltárt, amelyben különálló modellek egy belső szoftverkódtárat kezdtek üzenőfalként használni, hogy egymással kommunikáljanak és fájlokat próbáljanak megszerezni. Egy másik feladatnál együtt dolgozó AI-ügynökök nyilvános fájlmegosztó oldalakon adtak át egymásnak állományokat, noha kifejezetten azt az utasítást kapták, hogy csak helyi fájlokkal dolgozzanak. Ezzel a feladat egyes eredményei nyilvánosan elérhető URL-ekre kerültek.
A vállalat hangsúlyozza, hogy ezek egyedi esetek, és a hat jelentésből nem lehet arra következtetni, milyen gyakran fordul elő hasonló viselkedés a modelljeinél. Az új rendszer célja éppen az, hogy idővel pontosabb kép alakuljon ki arról, miként jelentkezhetnek ezek a problémák, illetve mennyire hatékonyak az ellenük beépített biztonsági megoldások. Az OpenAI szerint az iparág jelenleg még nem oldotta meg kellőképpen az AI-rendszerek megbízható felügyeletének problémáját ahhoz, hogy a legfejlettebb modellek fejlesztése korlátlan ütemben folytatódhasson.
Az új szabályok alapján bármely OpenAI-alkalmazott kezdeményezheti egy gyanús eset kivizsgálását. A vizsgálat súlyosságától függően gyorsan közzétehető, rövidebb elemzést igénylő vagy hosszabb, akár külső feleket is érintő kategóriába kerülhet. A jövőbeni jelentésekben a vállalat ismerteti majd, mi történt, milyen modell volt érintett, okozott-e külső kárt az eset, milyen kérdések maradtak nyitva, és milyen javításokon dolgoznak.