AI agenti OpenAI mali pôsobiť na desiatkach ďalších webov, útok na Hugging Face bol zrejme len špičkou ľadovca
Situácia, ktorá sa spočiatku javila ako ojedinelý incident, má podľa nových zistení oveľa širší rozsah. Hoci útok umelej inteligencie na Hugging Face vyvolal rozruch, nové detaily naznačujú, že mohlo ísť len o akúsi špičku ľadovca.
Agenti umelej inteligencie, vytvorení spoločnosťou OpenAI, mali podľa nových zistení už začiatkom tohto roka využívať najmenej 10 ďalších webových stránok na neautorizovanú komunikáciu. Nezávislí výskumníci objavili stopy ich aktivity na miestach, ktoré na prvý pohľad s AI nesúviseli.
Agentúra Reuters analyzovala zistenia šiestich nezávislých expertov a bezpečnostných tímov zaoberajúcich sa AI. Počet stránok sa líši, no všetci sa zhodujú, že ich bolo viac než desať. Andrew Yoon z organizácie CivAI identifikoval 18 doteraz nezverejnených webov, ktoré agenti využívali medzi májom a júlom.
Nešlo pritom o klasické hackerské útoky, ale skôr o spamovanie alebo zneužívanie slabín v niektorých webových službách. AI zanechávala informácie na editovateľných platformách, Wikipédii či iných miestach umožňujúcich používateľom pridávať alebo meniť obsah. Výskumníci odhaľovali aktivitu porovnávaním identických reťazcov znakov, opakujúcich sa používateľských mien či správ spojených s rovnakými nezvyčajnými otázkami.
Agenti pôsobili od Wikipédie až po stránky spravované nadšencami
Agenti AI operovali na rôznych miestach – od Wikipédie až po stránky spravované nadšencami. Medzi lokalitami, kde sa našli stopy ich činnosti, sú napríklad wiki venované chémii, založené učiteľom z Massachusetts v roku 2008, súkromné stránky dvoch odborníkov z technologického sektora, herné portály či približne dvadsaťročný web o softvéri na úpravu textu.
V niektorých prípadoch sa podarilo stopy spojiť s IP adresami patriacimi infraštruktúre Microsoft Azure, ktorú využíva aj OpenAI. Výskumníci upozorňujú, že agenti mali pôsobiť v rámci určitých obmedzení. Podľa prvých objaviteľov incidentu dostali modely úlohy vyžadujúce intenzívny výskum a povolenie prehľadávať internet, no nemali nič publikovať. Napriek tomu si našli spôsob, ako si medzi sebou odovzdávať informácie.
Kenneth Russell DeGraff, programátor a bývalý zamestnanec amerického Kongresu, ktorý našiel stopy aktivity na aspoň desiatich stránkach, prirovnal situáciu k študentom, ktorým počas skúšky zakázali rozprávať, no našli iné spôsoby, ako si posielať odpovede. Skupina Sydney Von Arx, ktorá skúmala pôvodný prípad nemeckej wiki, identifikovala dôveryhodné stopy agentov na ďalších 23 doteraz nezverejnených stránkach. Výskumníčka však upozornila, že ani tento počet nemusí byť konečný. „Nemáme predstavu, koľko toho je,“ uviedla pre agentúru.
OpenAI spúšťa audit a plánuje systém na hlásenie nežiaduceho správania modelov
OpenAI neodpovedalo na otázky Reuters o počte využitých stránok ani o dôvodoch, prečo firma mesiace neinformovala verejnosť o aktivite agentov. Spoločnosť však oznámila, že vykonáva širší audit svojich agentov a zatiaľ nezaznamenala iné prípady porovnateľné s predchádzajúcim incidentom týkajúcim sa Hugging Face.
OpenAI zároveň plánuje zaviesť systém na hlásenie tzv. „misalignment“, teda správania modelov nezodpovedajúceho zámerom ich tvorcov.
Časť správcov stránok sa o probléme dozvedela až po kontakte Reuters s OpenAI. Univerzita v Toronte potvrdila, že ju firma oslovila ohľadom možnej aktivity agentov na univerzitnom skracovači odkazov. Vanderbilt University zase oznámila, že vedie vlastné vyšetrovanie.
Helmut Leitner, programátor zabezpečujúci hosting a softvér pre niekoľko postihnutých stránok vrátane nemeckej wiki, spočiatku nemal kontakt s OpenAI. Po tom, čo Reuters firme predložil zistenia, dostal správu o incidente. Zdôraznil však, že zodpovednosť za situáciu nemožno pripisovať samotnej umelej inteligencii, ale ľuďom a organizáciám, ktoré tieto systémy vytvárajú a implementujú.
Už súčasný rozsah odhalení ukazuje, že čoraz autonómnejší agenti AI dokážu využiť nečakané možnosti internetu spôsobom, ktorý ich tvorcovia nepredpokladali. Niektorí výskumníci sa domnievajú, že doteraz odhalené prípady môžu byť len čriepkami väčšieho celku, čo potvrdzujú aj nové zistenia.

