Stačilo správne sformulovať pokyn. Čínska AI prezradila, ako vyrobiť biologické zbrane či spáchať atentát
Čínsky AI nástroj porušil vlastné bezpečnostné pravidlá, čo upozornilo na vážnu slabinu umelej inteligencie. Pomocou špeciálne vytvorených pokynov dokázali experti prelomiť jeho ochranné mechanizmy a prinútiť ho reagovať aj na témy, ktoré mal systém blokovať.
Čínsky vývojár umelej inteligencie Moonshot preveruje bezpečnostné nedostatky svojich modelov Kimi. Spoločnosť Mindgard, ktorá testuje bezpečnosť systémov AI, v júli zistila, že dva modely – Kimi K2.6 a K3 Swarm – dokážu po sérii špeciálne vytvorených pokynov obísť ochranné mechanizmy. Výskumníci ich tak dokázali prinútiť diskutovať aj o výrobe biologických zbraní či vykonávaní atentátov.
O zisteniach informovala BBC, ktorej Mindgard poskytol podrobnosti.
Nový model OpenAI mal byť výkonnejší, no firma ho neuvoľní. Interné testy odhalili bezpečnostné nedostatky
Ochrany dokázali prelomiť
Postup, ktorý výskumníci použili, sa označuje ako jailbreaking. Ide o sériu zložitých inštrukcií, ktorých cieľom je prinútiť systém ignorovať bezpečnostné obmedzenia nastavené jeho vývojármi.
Mindgard uviedol, že ochranné mechanizmy Kimi mali zabrániť práve diskusiám o nebezpečných témach. Po ich prelomení však model podľa spoločnosti poskytoval odpovede aj na takéto požiadavky.
Zakladateľ Mindgardu Peter Garraghan v programe BBC World Service Tech Life upozornil, že problém nemusí zostať pri jednej konkrétnej otázke.
„Keď jailbreak funguje, bude hovoriť o akejkoľvek téme, dokonca bude slobodne ponúkať odporúčania o iných témach, ktoré sú tiež nebezpečné, a bude vynaliezavý a kreatívny,“ povedal.
Mindgard zároveň neoveroval, či by informácie, ktoré Kimi poskytol, boli v praxi použiteľné. Podľa spoločnosti však už samotná schopnosť modelu zapojiť sa do takejto diskusie znamená zlyhanie ochranných mechanizmov.
OpenAI zastavila trénovanie svojich modelov. Jej agenti robili na vládnych weboch veci, ktoré im nikto nezadal
Riziko predstavuje aj kybernetická bezpečnosť
Mindgard upozornil na ďalší možný problém. Podľa spoločnosti by prelomený Kimi K2.6 mohol umožniť hackerom spúšťať kód vo výpočtovom prostredí modelu a pripájať sa na internet. Za určitých okolností by sa tak podľa firmy mohol stať odrazovým mostíkom pre kybernetické útoky.
Garraghan obhajoval rozhodnutie Mindgardu zverejniť informácie o probléme. Spoločnosť podľa neho najskôr informovala vývojára a zároveň nezverejnila kľúčové detaily o tom, ako presne sa jej podarilo bezpečnostné zábrany obísť.
Mindgard upozornil Moonshot na problém e-mailom 27. júla. Približne o týždeň neskôr dostal odpoveď a 12. septembra zverejnil o zisteniach blog. Spoločnosť však uviedla, že Moonshot sa jej opätovne ozval až po tom, čo ju BBC požiadala o komentár.
Test nového modelu od OpenAI odhalil nové riziko. Umelá inteligencia sa pokúsila preniknúť do vládnych systémov
Moonshot hovorí o interných kontrolách
Moonshot pre BBC uviedol, že víta spätnú väzbu od tretích strán „ako kľúčový pilier pre budovanie lepšej a bezpečnejšej umelej inteligencie“. Spoločnosť zároveň uviedla, že s Mindgardom o zisteniach rokuje.
V e-maile, ktorý Moonshot zdieľal s BBC, firma uviedla, že jej model vo všeobecnosti vykazoval „vysokú mieru odmietnutia týchto typov žiadostí“ počas interných hodnotení.
Zistenia Mindgardu prichádzajú v čase, keď sa podobné bezpečnostné riziká objavujú aj pri iných systémoch umelej inteligencie.
Jailbreaking zároveň predstavuje odlišný typ hrozby než incidenty, pri ktorých boli v poslednom období zneužité autonómne AI systémy. Takzvaní agenti, ktoré vyvíjajú napríklad spoločnosti OpenAI, Meta či Anthropic, sa v niektorých prípadoch dostali až k útokom na online služby.
Prelomenie ochranných mechanizmov môže byť síce náročné a vyžaduje si čas i skúsenosti, odborníci však upozorňujú, že podobné postupy môžu skúsiť zneužiť hackeri alebo iní útočníci. Anthropic nedávno oznámil, že odhalil a zastavil pokusy využiť jeden zo svojich modelov na „škodlivú činnosť“, ktorá by mohla podporiť vývoj biologických zbraní.
„Naozaj sa boja.“ Bývalý výskumník Anthropicu opisuje obavy ľudí, ktorí umelú inteligenciu vyvíjajú
Otázka otvorených modelov
Prípad zároveň otvára širšiu diskusiu o bezpečnosti modelov s otvorenými váhami. Kimi patrí medzi takéto systémy, čo znamená, že ho možno teoreticky prevádzkovať na vlastnej výpočtovej infraštruktúre.
Odvetvie AI sa pritom nezhoduje na tom, či sú bezpečnejšie uzavreté proprietárne modely, ktoré využívajú napríklad ChatGPT či Claude od Anthropic, alebo modely s otvorenými váhami.
Profesor Alan Woodward z University of Surrey pre BBC upozornil, že otvorené modely môžu skončiť v nesprávnych rukách. Zároveň však podľa neho môžu byť užitočné pri kybernetickej obrane.
Ako príklad uviedol spoločnosť Hugging Face, ktorá použila čínsky model s otvorenými váhami na analýzu hackerského útoku. Neskôr sa ukázalo, že za útokom stáli agenti OpenAI.
Woodward zároveň upozornil, že regulácia nedokáže držať krok s rýchlosťou vývoja umelej inteligencie.
„Trvalo nám desaťročia, kým sme sa dohodli na formáte telefónnych čísel.“
Podobne ako Garraghan sa preto domnieva, že väčšia pozornosť by sa mala venovať identifikácii a stíhaniu ľudí, ktorí umelú inteligenciu zneužívajú.
Vývoj umelej inteligencie by sa mal spomaliť, tvrdí šéf Anthropicu. Už teraz pomáha pri zločinoch a predstavuje riziko