Britų kibernetinio saugumo bendrovės Mindgard tyrėjai pranešė aptikę būdą, kaip apeiti kiniškos „Moonshot AI“ kuriamų DI modelių saugiklius. Bandymų metu modeliai pradėjo generuoti atsakymus temomis, kurios įprastai turėtų būti griežtai blokuojamos, įskaitant biologinių ginklų kūrimą.
Pažeidžiamumas siejamas su modeliais Kimi K2.6 ir K3 Swarm. Mindgard teigia apie problemą „Moonshot AI“ informavusi dar liepos pabaigoje, o rugsėjį pati bendrovė paskelbė pažeidžiamumo aprašą ir BBC patvirtino, kad vertina tyrėjų išvadas.
Kas yra jailbreakas ir kodėl tai veikia
Tyrėjų naudota technika vadinama jailbreaku. Tai metodas, kai pateikiamos specialiai sukonstruotos instrukcijos, skirtos priversti DI ignoruoti saugos taisykles ir vidinius filtrus.
Įprastomis sąlygomis tokie modeliai turėtų atsisakyti atsakyti į klausimus apie biologinius ginklus ar smurto planavimą. Tačiau Mindgard teigia, kad po sėkmingo jailbreako Kimi apribojimai nebeveikė, o modelis ne tik atsakinėjo, bet ir pats siūlė tolesnes potencialiai žalingas pokalbio kryptis.
Kokia reali rizika
Mindgard pabrėžia, kad nevertino, ar DI sugeneruota informacija iš tiesų būtų praktiškai pritaikoma biologinių ginklų kūrimui. Vis dėlto saugumo požiūriu problema laikoma rimta jau vien dėl to, kad apsaugos mechanizmai turėjo užkirsti kelią tokiai tematikai nepriklausomai nuo atsakymų naudingumo.
Papildomą riziką didina tai, kad pažangūs DI modeliai informaciją pateikia gerokai greičiau nei tradicinė paieška. Jei sistema turi prieigą prie įrankių, interneto ar kodo vykdymo, sėkmingas saugiklių apėjimas gali būti išnaudotas ir platesniems kenksmingiems scenarijams.
Pasak Mindgard, perimtas Kimi K2.6 potencialiai galėjo sudaryti sąlygas vykdyti kodą, naudoti skaičiavimo resursus ir jungtis prie interneto. Tokios galimybės, tyrėjų vertinimu, teoriškai galėtų paversti DI sistemos aplinką kibernetinių atakų infrastruktūros dalimi.
Kaip reaguoja „Moonshot AI“ ir ką tai rodo rinkai
„Moonshot AI“ BBC teigė, kad nepriklausomi testai yra svarbi modelių saugumo gerinimo dalis. Bendrovė taip pat nurodė, jog jos vidiniuose bandymuose Kimi dažniausiai atsisakydavo vykdyti pavojingus prašymus, tačiau pradėjo nagrinėti Mindgard pateiktas išvadas.
Mindgard skelbia nepublikavusi techninių detalių, kurios leistų tiksliai atkartoti saugiklių apėjimo metodą. Taip siekiama sumažinti riziką, kad spraga bus greitai pritaikyta piktavališkiems tikslams.
Ekspertai vis dažniau akcentuoja, kad vien filtrų nepakanka, kai atsiranda vis naujų jailbreako metodų. Be to, iššūkiai nėra susiję tik su vienu regionu ar vienu kūrėju, nes panašius bandymus ir rizikas pastaruoju metu viešai yra aptarusios ir kitos DI bendrovės, o tai rodo sisteminę problemą visoje rinkoje.
Augant modelių gebėjimams, svarbėja keli dalykai: nuolatiniai nepriklausomi saugumo testai, greitas pažeidžiamumų taisymas, aiškios naudojimo politikos ir efektyvesnis piktnaudžiavimo aptikimas. Kuo DI labiau integruojamas į įrankius ir realius procesus, tuo daugiau dėmesio tenka ne tik atsakymų turiniui, bet ir tam, ką sistema realiai gali atlikti.
