Hirdetés

Álprofilokkal próbált embereket átverni, majd megkísérelte eltüntetni a nyomait az Antropic AI-ügynöke



|

Egy teszten az Anthropic és az OpenAI kísérleti modelljei a vártnál jóval önállóbban viselkedtek, a legsúlyosabb akciókat azonban embereknek kellett megállítaniuk.

Hirdetés

A brit AI Security Institute szerint két fejlett AI-modell olyan mértékű önállóságot mutatott egy kiberbiztonsági teszten, amilyennel az intézet korábban soha nem találkozott. Az Anthropic Mythos és az OpenAI Sol nevű modelljei hamis, valódi személyeket utánzó profilokat is létrehoztak, miközben egy GitHubhoz kapcsolódó feladat megoldásán dolgoztak.

A csapat a kutatási rendszereket elhagyó szokatlan adatforgalomra lettek figyelmesek és a későbbi vizsgálat szerint egyes ügynökök tartós és potenciálisan káros műveleteket végeztek valódi emberek és szervezetek ellen.

A két modell közül messze a Mythos hajtotta végre a legtöbb problémás lépést.

Hirdetés

A legsúlyosabb esetben a Mythos egyik ügynöke megpróbált rávenni GitHubos adminokat egy rosszindulatú kód jóváhagyására. Ehhez felkutatta az érintetteket, a személyazonosságukat utánzó fiókokat készített, majd privát üzenetekkel és fájlmegosztón keresztül küldött anyagokkal próbált nyomást gyakorolni rájuk.

Amikor a rendszert számon kérték a tevékenysége miatt, korábbi műveleteit ártalmatlannak próbálta feltüntetni, és egy új személyazonosság használatát is fontolóra vette a folytatáshoz.

Az AISI szerint a modellt nem utasították kifejezetten megtévesztésre vagy a nyomok eltüntetésére, de a jó hír, hogy a rosszindulatú kód végül nem jutott el a GitHub rendszerébe, mert minden kritikus művelethez emberi jóváhagyásra volt szüksége.

Az Anthropic és az OpenAI természetesen azonnal jelezték, hogy a kísérlet nem a nyilvánosan elérhető szolgáltatásokkal készült, mert a teszt során csökkentették vagy eltávolították a normál biztonsági korlátozásokat, az ügynökök pedig hozzáférhettek a nyílt internethez. Az AISI szerint éppen erre volt szükség ahhoz, hogy felmérjék, mire lehetnek képesek a modellek rosszindulatú felhasználók kezében.

A Microsoft tulajdonában lévő GitHubot értesítették a történtekről, őket pedig le is tiltották a hamis profilokat. Az AISI hangsúlyozta, hogy csak néhány, különleges körülmények között bekövetkezett esetről van szó, a megfigyelt önállóság és megtévesztés mértéke azonban így is elég ijesztő.

Hirdetés

Úgy tűnik, AdBlockert használsz, amivel megakadályozod a reklámok megjelenítését. Amennyiben szeretnéd támogatni a munkánkat, kérjük add hozzá az oldalt a kivételek listájához, vagy támogass minket közvetlenül! További információért kattints!

Engedélyezi, hogy a https://www.pcwplus.hu értesítéseket küldjön Önnek a kiemelt hírekről? Az értesítések bármikor kikapcsolhatók a böngésző beállításaiban.