Egyre több az olyan okoseszköz, ami hanggal is vezérelhető - az irányítás eme természetes módja felhasználói szempontból roppant kényelmes, adatvédelmi szempontból viszont sokakban komoly aggodalmat vet fel, hogy nem kíváncsibbak-e a kelleténél ezek az eszközök. Szinte mindenkinek van olyan története, amikor egy délutáni baráti beszélgetésben elhangzik az utazás szó, estére pedig a weboldalakon elhelyezett hirdetések jobbnál jobb repülőjegy akciókat kínálnak. Kézenfekvő magyarázat, hogy a Facebook vagy a telefon folyamatosan hallgatózik a mikrofonon keresztül, majd az így megszerzett információkat felhasználva a hirdetéskiszolgáló rendszer már adagolja is a passzoló hirdetéseket.
A valóság azonban ennél sokkal prózaibb: a Meta, a Google és a többi "adatszivattyút" használó cég nemcsak saját tevékenységed, hanem akár barátaid tevékenysége alapján is alakítja a profilodat. Hogyan működik ez a valóságban? Ha valakivel egy helyen tartózkodsz, és az illető később rákeres egy utazásra, akkor - például - a Facebook nemcsak azt feltételezi, hogy találkoztatok, hanem azt is, hogy beszéltetek az utazásról. És ezt az információt be is építi a rólad alkotott képbe.
Evolúció: buta -> okos -> AI okos
A hangvezérlés roppant kényelmes, de csak akkor működik hatékonyan, ha az eszköz, amit vagy amivel irányítani szeretnél, képes pontosan értelmezni az utasításokat. Ha visszamegyünk pár évet az időben, akkor azt látjuk, hogy egy tévé esetében például elég jól behatárolható volt, milyen parancsokra kellett felkészülnie a gyártóknak: hangerő változtatása, csatornaváltás és bemenet kiválasztása. Ez volt az első fontos lépés, amely a buta tévéktől az okos eszközök felé vezetett. Ám a használhatóság meglehetősen korlátozott volt; ráadásul amellett, hogy a hangfelismerés a gyártók által kitalált, alapvető parancsokkal működött csak, kezdetben a kütyük a "hunglish"-t, vagyis a nem tökéletes angol kiejtést sem értették.
A mesterséges intelligencia azonban a hangutasítások terén is komoly előrelépést hozott. A rendszerek most már nemcsak az alapdolgokat értik, hanem a komplex utasításokat is pontos(abb)an tudják értelmezni. A mesterséges intelligencia révén az eszközök megértik a természetes beszédet, és képesek értelmezni az előzményeket, a szövegkörnyezetet és a beszélő szándékát is. Egy tévé esetén ma már teljesen jól működik például az, ha arra kéred a kütyüt, hogy ajánljon neked egy olyan filmet, ami segít kicsit kizökkenni a hétköznapok monotonitásából.
Elmondhatod, hogy éppen milyen hangulatod van, és máris érkeznek a találatok a különféle tévécsatornáktól, a Netflixtől vagy akár a YouTube-ról is. A pontossághoz viszont nagy nyelvi modellekre és nagy számítási kapacitásra van szükség, ezért a gyártók - érthető módon - inkább a felhőben szeretik megoldani a hangvezérlést, nem pedig az eszközökön.
Itt érdemes megállni egy pillanatra, és megnézni, hogyan működik általánosságban a hangvezérlés. A funkciót valamilyen módon aktiválni kell: ez lehet egy meghatározott mozdulat a telefonon, egy gomb a távirányítón vagy akár egy kulcsszó is. A gesztussal és gombbal történő aktiválás tiszta sor, a mikrofon csak akkor kapcsol be, ha kiadod a parancsot. Trükkösebb a helyzet, ha a hangvezérlés aktiválása kulcsszó segítségével történik (pl. OK, Google; Hey, Siri; Hi LG; Hi TV; Alexa; stb.).
A gyártók ebben az esetben szinte mindig hibrid modellt alkalmaznak, ami azt jelenti, hogy az eszköz mikrofonja folyamatosan be van kapcsolva, és az eszköz maga valóban fülel, hiszen várja, mikor hangzik el a kulcsszó. Ennek felismerése nem a felhőben, hanem helyben történik, így nincs szükség az elhangzottak rögzítésére, tárolására és elküldésére sem. Amint az eszköz felébredt és várja a hangutasításokat, akkor viszont már rögzíti is, amit hall, és a kérést, parancsot tartalmazó fájlt elküldi a központi szerverre, amely értelmezi a mondandónkat.
És a bajok itt kezdődnek. Onnantól ugyanis, hogy a felvétel kikerül az ellenőrzésünk alól, fogalmunk sincs, hogy mi fog történni vele. Nyilván a hangutasítást értelmezi az okoskütyü, de hogy ezen túl a cégek mire használják az adatot, azzal jóformán senki sincs tisztában. A helyzet tényleg zavaros: minden cég máshogyan kezeli a felvételeket. Annyi közös pont van, hogy mivel mindenki szeretné fejleszteni a mesterséges intelligencia modelljét, és ehhez adat kell, a vállalatok "törekednek" arra, hogy a felvételeket hosszabb-rövidebb ideig tárolják. A legnagyobb probléma az, hogy mezei felhasználóként esélyünk sincs arra, hogy ellenőrizzük, az ígért felhasználói feltételek teljesülnek-e vagy sem. Az alábbiakban a teljesség igénye nélkül megmutatjuk, papíron mit vállal néhány nagyobb gyártók.
Amazon Alexa: A cég alapértelmezés szerint korlátlan ideig megtartja a hangfelvételt és a róla készült átiratot is. Ha szeretnéd, kérheted az automatikus törlést 3-18 hónapos időintervallumban, vagy azt is, hogy a szolgáltató egyáltalán ne tárolja el a felvételeket. Apró szépséghiba a dologban, hogy a cég idén tavasszal kapott egy 30 millió dolláros bírságot azért, mert a felvételeket titokban azoknál a felhasználóknál is megtartotta, akik kérték az előzmények törlését.
Google: Alapértelmezés szerint 18 hónapig őrzi meg a személyes adatokat, ezt az időintervallumot azonban módosíthatod 3-36 hónap között, illetve a Google-nél is kérheted, hogy a személyes adatokat egyáltalán ne tárolja a cég.
Apple: Az almás cég viszonylag felhasználóbarát módon áll a kérdéshez. A szöveges átiratokat első körben 6 hónapig őrzi meg, viszont tárolás előtt anonimizálja őket, a mesterséges intelligencia modellek betanításához pedig csak kifejezett hozzájárulás esetén (opt-in) használja a felvételeket. A hat hónapos időszak eltelte után a vállalat további két évig megőrzi az átiratokat, és tesztelési célokra használja - bármit is jelentsen ez.
LG: A tévék a hangutasításokat első körben helyben dolgozzák fel, a kulcsszót követően pedig legfeljebb 18 másodpercig aktív a mikrofon. A hangutasítás elemzése a felhőben történik, az LG ezt követően törli a hangfelvételt - az átiratot viszont megőrzi.
Samsung: A másik koreai gyártó tévéi a hangutasításokat szintén központi szerverre továbbítják feldolgozásra, ezt követően a vállalat a felvételeket nem őrzi meg.
Ez legalábbis a hivatalos közlemények szerinti eljárás…
Sok az adat
A mikrofonnal és kamerával rendelkező okoseszközöknél időről időre felmerül, hogy a termékek titokban is készítenek felvételeket. A gyártók igyekeznek olyan megoldásokat alkalmazni, ami megnyugtatja a felhasználókat. Androidon például zöld színű pötty jelzi az állapotsorban, ha bármilyen alkalmazás éppen használja a kamerát vagy a mikrofont. A funkciót az operációs rendszer biztosítja, ezért elvileg megkerülhetetlen. A notebookgyártóknál is hosszabb ideje bevett szokás, hogy az aktív kamerahasználatot a kamera melletti LED mutatja - egyes típusoknál pedig még arra is van lehetőség, hogy fizikailag takard el az objektívet.
De térjünk vissza arra a felvetésre, hogy sokak szerint az okoskütyük mindig hallgatóznak. Ha logikusan közelítjük meg a kérdést, akkor látszik, hogy egészen valószínűtlen, hogy bármelyik okoseszköz is folyamatosan hangfelvételt készítene, és azt továbbítaná gyártója központi szervereire. Noha csak hangról van szó, 128 kb/s-os bitrátát feltételezve napi szinten 1,3, havi szinten 42 GB adatmennyiség keletkezne egyetlen eszköz esetében - ez pedig már olyan adatforgalom, ami könnyen kiszúrható otthoni környezetben, főleg "felfelé" irányban. Ha tehát a jelenség általános és tömeges lenne, akkor világszerte rengeteg felhasználó adna visszajelzést arról, hogy itt valami nincs rendben.
Rögtön az a kérdés is felmerül persze, hogy milyen haszna származhat egy gyártónak abból, ha tárolja a hangutasítások felvételeit. Alapvetően három tengely mentén mozoghatunk a kérdés megválaszolásakor.
- Az adat segítségével a gyártó profilt alkot a felhasználóról, és azt célzott hirdetésekhez használhatja,
- Az adatokat más piaci szereplők számára értékesítheti (jellemzően nem nyers formában, hanem feldolgozva),
- Az adatokat arra is használhatja, hogy saját AI nyelvi modelljének tudását pallérozza.
Az Európai Unióban mind a három tevékenység olyan tevékenység, ami explicit felhasználói hozzájárulás nélkül elvileg legalábbis nem végezhető, erről a GDPR és a DMA (digitális piacokról szóló) rendeletek gondoskodnak. Itt nem holmi gumiszabályról van szó, amit jól mutat, hogy - többek között - a Microsoft, a Facebook és az Apple sem aktivált számos mesterséges intelligenciához kapcsolódó technológiát az európai felhasználók számára éppen azért, mert a jogi következmények elég súlyosak. Ez alapján a hazai felhasználók még akkor is nagyobb biztonságban érezhetik magukat, ha egy telefon, egy tévé vagy egy okoshangszóró szereti gyűjteni az adatokat.
De térjünk vissza az LG tévéihez! A Level1Techs nevű YouTuber független biztonsági szakértőkkel vizsgálta meg a gyártók készülékeit, és arra a következtetésre jutott, hogy a tévék feltérképezik a hálózaton elérhető eszközöket, valamint képesek a hangfelvétel rögzítésére akár kikapcsolt állapotban is. Az LG közleménye előbbivel nem foglalkozik (a csatlakozó eszközöket egyébként nemcsak a tévé, hanem a router és rengeteg más eszköz is folyamatosan pásztázza), utóbbit tényt viszont határozottan cáfolja.
És a helyzet az, hogy egyértelmű, megdönthetetlen bizonyítékkal a szakértők nem szolgáltak. A hálózati forgalom elemzése sok mindent megmutat, de sok mindent nem tud felfedni. Önmagában az hogy a tévé kommunikál az LG szervereivel, még nem feltétlenül jelenti azt, hogy suttyomban olyat csinál, amit nem kéne, az adatforgalom lehet legális is. Szinte minden tévégyártó használja például az ACR (Automatic Content Recognition) technológiát, amelynek célja az éppen megjelenített tartalom elemzése bemenettől függetlenül, mégpedig a hirdetések targetálása érdekében. És itt adott esetben akár elég részletes elemzésről van szó, 2025-ben a Las Vegas-i CES-en a gyártó például azt is demózta, hogy a mesterséges intelligencia képes akár még arra is, hogy egy, az aktuális jelenetben megjelenő táskát vagy a főszereplő ruháját megkeresse egy online áruházban.
Nyilván már ez is aggályos lehet, hiszen az ACR nemcsak a tévéadásokkal működik, hanem akkor is, ha például notebookot csatlakoztatsz a HDMI-bemenetre; ilyenkor pedig sokan nem is gondolnak arra, hogy ha megnyitnak egy céges dokumentumot, akkor a tévé valamilyen szinten azt is elemzi. (Egyébként képkocka vagy hangminta ilyenkor sem jut el a gyártók szervereire, a képről és hangról egyszerűsített lenyomat készül, és ez a lenyomat képezi az elemzés alapját.)
Az ACR-t egyébként a legtöbb esetben legalább ki lehet kapcsolni, azonban a gyártók hajlamosak arra, hogy ezt a lehetőséget eldugják - adott esetben akár úgy is, hogy az egyszer megadott engedély nem vonható vissza csak akkor, ha teljes gyári visszaállítást hajtasz végre a készüléken.
Hogyan tudsz védekezni?
Tökéletesen biztos mód csak egy van, mégpedig az, ha az okoseszközt (legyen az tévé, telefon, hangszóró stb.) nem csatlakoztatod az internetre. Ebben az esetben persze lényegét veszíti az "okos" jelző. Bár biztos lehetsz abban, hogy a kütyü nem gyűjt adatot, vagy ha mégis, akkor azt nem tudja kinek elküldeni, egyszersmind számolnod kell azzal is, hogy az okosfunkciók nem működnek.
A második legjobb dolog, amit tehetsz, hogy amennyire csak lehet, különválasztod az okoskütyüket. A tévé vagy az okoshangszóró számára létrehozhatsz például saját felhasználói fiókot, és ha az okoseszközöket emellett még egy teljesen más névvel rendelkező, IoT Wi-Fi-hálózatra kötöd, akkor legalább annak az esélyét minimalizálod, hogy az eszköz gyártója, a Facebook, a Google vagy bárki más összekapcsolja az adatokat a normál felhasználói fiókoddal. Ezzel egy időben természetesen a beállításokat is át kell nézni töviről hegyire, és az összes kapcsolót, ami az adatgyűjtéssel, profilalkotással kapcsolatos, a megfelelő állásba kell billenteni.
Ha profi megoldást keresel, akkor az okoseszközt saját DNS szerveren keresztül is kiengedheted az internetre (pl. PiHole). Ha minden oldal általános tiltása mellett csak azokat a weboldalakat oldod fel, amiket a tévével, hangszóróval használni szeretnél, megakadályozhatod a gyártó szervereivel való kommunikációt. Persze ennek is megvan az árnyoldala: a hangutasítások például nem fognak működni, de tény, hogy legalább a számodra fontos okosfunkciókat megtarthatod. Az újabb termékeknél ez a módszer azonban nem biztos, hogy működik, mivel a gyártók is ismerik a trükköt; és beégetett DNS-sel védekeznek ellene. Azaz mindegy, hogy milyen DNS-t állítasz be, a tévé akkor is - jellemzően - a Google-féle 8.8.8.8-at fogja használni.
Összegzés
A mesterséges intelligencia által hajtott hangvezérlés kétségkívül kényelmesebbé tette az okoseszközök használatát, ám a természetes beszédértés ára a felhőalapú adatfeldolgozás lett. Bár a folyamatos hallgatózásról szóló tévhitekkel ellentétben a mikrofonok jellemzően csak a kulcsszó elhangzása után rögzítenek, a szerverekre kerülő hanganyagok és átiratok sorsa gyakran átláthatatlan. Az EU-s szabályozások és a hálózati elkülönítések adnak némi védelmet, de a teljes adatvédelem és a maximális kényelem továbbra is kizárja egymást.