Az OpenAI ideiglenesen felfüggesztett minden olyan belső munkát a készülő Astra modelljével, amely még nem felel meg a vállalat új, szigorúbb biztonsági követelményeinek. Az előzetes tesztek szerint ugyanis az AI olyan nagyot fejlődött az önálló programozás területén, hogy az OpenAI már nem érzi biztonságosnak.
A modell értékelése még tart, az eddigi eredményei azonban elég ijesztőek ahhoz, hogy a vállalat a legrosszabb lehetőséggel is számoljon. Az OpenAI meghatározása szerint a kritikus küszöböt az a rendszer éri el, amely emberi segítség nélkül képes működő exploitokat készíteni korábban ismeretlen, úgynevezett nulladik napi sebezhetőségekhez, vagy egy konkrét cél alapján önállóan megtervezni és végrehajtani egy összetett kibertámadást komolyan védett célpontok ellen.
Az Astra teljes fejlesztését nem állították le, a további munkát azonban elszigetelt tesztkörnyezetekbe terelik, korlátozzák a modell hálózati és eszközhozzáférését, valamint elzárt homokozóban futtatják a műveleteit. Megerősítik a modell működését meghatározó súlyok védelmét és titkosítását, további észlelőrendszereket vezetnek be, az Astra kockázatos műveleteit pedig a tanítás és az értékelés során is folyamatosan figyelik.
Az OpenAI kormányzati szerveket és AI-val foglalkozó biztonsági intézeteket is bevon az Astra képességeinek ellenőrzésébe.
Az Astra nem vett részt abban a júliusi incidensben, amelynek során OpenAI-modellek kijutottak egy elszigetelt tesztkörnyezetből, majd hozzáfértek a Hugging Face éles infrastruktúrájához. Az utóbbi hetekben az Anthropic és a Meta is beszámolt olyan kiberbiztonsági tesztekről, amelyekben modelljeik valódi vállalatok rendszereibe jutottak be, több esetben azonban hibásan beállított vagy szándékosan internetre engedett tesztkörnyezet tette lehetővé a történteket.
Az OpenAI szerint a fejlett kiberbiztonsági modelleknek elsősorban a védekezőket kellene segíteniük, hogy még a támadók előtt megtalálják és kijavítsák a sérülékenységeket. Ugyanezek a képességek viszont támadásra is használhatók, az Astra előzetes eredményei pedig arra utalnak, hogy ez a kettősség nem egy elméleti probléma.