Lenkijos valstybinis tyrimų institutas NASK pristatė „DROZD“ – sukurtą sprendimą, skirtą aptikti ir analizuoti deepfake turinį, kuriame vaizdas, garsas ar tekstas būna suklastoti pasitelkiant DI. Institutas pabrėžia, kad tokių klastočių kūrimo barjeras mažėja, o jų mastas socialiniuose tinkluose auga.
NASK atstovai akcentuoja, kad įtikinamai sintetinei medžiagai kartais pakanka kelių ar keliolikos sekundžių žmogaus kalbos pavyzdžio, vienos nuotraukos ar trumpo viešai prieinamo vaizdo įrašo. Dėl to vis dažniau klastotėse pasitelkiami vieši asmenys, kurių atpažįstamas veidas ar balsas sukuria klaidingą patikimumą.
Kas rodo mastą?
NASK teigimu, per penkių savaičių socialinių tinklų stebėseną buvo identifikuota apie 16 000 klaidinančių reklamų, kuriose aptikta sintetinės ar manipuliuotos medžiagos požymių. Ekspertai taip pat fiksavo daugiau nei 450 skirtingų tapatybių panaudojimo atvejų, kai klastotėse pasitelkiami realių žmonių veidai ar balsai.
„Įtikinamai sintetinei medžiagai sukurti šiandien dažnai pakanka keliolikos sekundžių žmogaus kalbos, o kartais net kelių sekundžių. Tai gali būti viena nuotrauka arba trumpas, viešai prieinamas įrašo fragmentas“, – sakė NASK Audiovizualinių analizių ir biometrinių sistemų padalinio vadovė dr. inž. Ewelina Bartuzi-Trokielewicz.
Institutas pažymi ir kitą problemą: kai kuriose turinio generavimo paslaugose norint sukurti vaizdo įrašą su konkretaus viešo asmens atvaizdu gali pakakti tik patvirtinti, kad turite teisę tą atvaizdą naudoti. Tai sukuria palankias sąlygas masinei klastočių gamybai.
Kaip veikia „DROZD“?
„DROZD“ sukurtas kaip daugiasluoksnis analizės įrankis, vertinantis vaizdą, garsą ir turinio prasmę bei kontekstą. NASK pabrėžia, kad tikslas yra sprendimas, galintis dirbti realiomis sąlygomis, kai įrašai būna suspausti, triukšmingi ar perkelti per socialinių tinklų platformas.
„Analizuojame vaizdinį sluoksnį, garso takelį ir žinutę, kuri perduodama įraše. Svarbiausia, kad sprendimai veiktų realiomis operacinėmis sąlygomis, įskaitant sudėtingą, triukšmingą medžiagą iš socialinių tinklų“, – sakė E. Bartuzi-Trokielewicz.
NASK aiškina, kad sistema gali išskirti garso takelį, paversti kalbą tekstu, vertinti balso bei garso požymius, grupuoti panašius veidus ir atskirai analizuoti skirtingus kalbėtojus. Taip tyrėjams nereikia vertinti viso ilgo įrašo kaip vieno objekto, o galima tiksliau tikrinti atskiras jo dalis.
„DROZD“ taip pat orientuotas į įrašų, analizės rezultatų ir etaloninių duomenų kaupimą, kad būtų galima greičiau atpažinti dažniausiai apgaulėse išnaudojamus veidus ar balsus. NASK pabrėžia, kad sprendimas yra modulinis, todėl atskiras dalis galima keisti ir pritaikyti pagal institucijų poreikius.
Kodėl deepfake’ai taip sunkiai suvaldomi?
Vienas didžiausių iššūkių – greitis ir mastas: apgaulingos kampanijos dažnai kuriamos iš dešimčių ar šimtų failų ir daugybės reklamų variantų su smulkiomis korekcijomis. Tai apsunkina moderavimą, ypač kai sukčiai naudoja technikas, skirtas paslėpti tikrąjį reklamos turinį nuo automatinės patikros.
NASK išskiria ir lip sync tipo manipuliacijas, kai paimamas autentiškas vaizdo įrašas, sugeneruojamas naujas balso pranešimas ir suderinamas lūpų judesys. Instituto vertinimu, būtent tokios klastotės ilgą laiką buvo sunkiai aptinkamos daugeliui rinkoje prieinamų detekcijos sprendimų.
Kartu daugėja ir kitų formatų: skaitmeniniai avatarai, sukurti iš vienos nuotraukos ar trumpo klipo, bei hibridinės klastotės, kur klasikinės vaizdo manipuliacijos maišomos su generatyviniais modeliais. NASK taip pat įspėja, kad vis dažniau gali plisti netikri „didelių įvykių“ vaizdai, pavyzdžiui, tariami gaisrai, sprogimai ar stichinės nelaimės.
Leave a Reply