Lenkijos NASK pristatė DROZD: įrankis, padedantis atpažinti deepfake vaizdus, garsą ir apgavystes

Written by

in

Lenkijos valstybinis tyrimų institutas NASK-PIB pristatė autorių sukurtą įrankį DROZD, skirtą aptikti ir analizuoti deepfake turinį. Sistema vienu metu vertina vaizdą, garsą ir teksto prasmę, kad nustatytų, kur medžiaga galėjo būti sukurta ar pakeista dirbtinis intelektas.

Institutas pabrėžia, kad įtikinamam suklastotam įrašui šiandien dažnai pakanka kelių ar keliolikos sekundžių žmogaus kalbos, o kartais ir vienos nuotraukos. Dėl to deepfake vis dažniau naudojami sukčiavimui, ypač socialiniuose tinkluose platinamose reklamose, kuriose išnaudojami žinomų žmonių veidai ir balsai.

Kas labiausiai kelia riziką?

NASK analitikai per penkias savaites vykdytą socialinių tinklų stebėseną nustatė apie 16 000 su sintetiniais elementais siejamų apgaulingų reklamų atvejų. Pasak instituto, tokio tipo kampanijos dažnai kuriamos masiškai, su daugybe variantų, o sukčiai nuolat keičia failus, kad išvengtų moderavimo.

„Įtikinamam sintetinės medžiagos sukūrimui šiandien dažnai pakanka keliolikos sekundžių žmogaus kalbos, o kartais net kelių sekundžių“, – sakė NASK Audiovizualinės analizės ir biometrinių sistemų padalinio vadovė dr. inž. Ewelina Bartuzi-Trokielewicz.

Ekspertai atkreipia dėmesį į sparčiai plintančius vadinamuosius lip-sync klastojimus, kai naudojamas tikras vaizdo įrašas, tačiau pakeičiamas balsas ir suderinamas lūpų judėjimas. Toks metodas dažnai atrodo įtikinamiau nei visiškai sugeneruotas vaizdas, todėl automatinėms sistemoms jį aptikti sunkiau.

Kaip veikia DROZD?

DROZD sukurtas taip, kad padėtų atlikti daugiapakopę analizę: nuo vaizdo ir garso požymių iki turinio konteksto bei kalbos struktūros. NASK teigimu, vienas tikslų yra užtikrinti, kad įrankis veiktų realiomis sąlygomis, įskaitant prastos kokybės ar „užterštą“ socialinių tinklų medžiagą.

„Analizuojame vizualinį sluoksnį, garso takelį ir pačią žinutę. Mums svarbu, kad įrankiai veiktų realiomis operacinėmis sąlygomis, įskaitant sudėtingą, triukšmingą medžiagą iš socialinių tinklų“, – sakė E. Bartuzi-Trokielewicz.

Praktikoje sistema gali išskirti garso takelį iš vaizdo įrašo, paversti kalbą tekstu, įvertinti balso ir vaizdo požymius, taip pat grupuoti panašius veidus ir balsus ilgesniuose įrašuose. Tai leidžia analizuoti ne visą įrašą kaip vieną objektą, o atskirus kalbėtojus ar kadrus, kur tikėtina manipuliacija.

NASK pabrėžia ir modulį, kuris gali būti pritaikomas konkrečių institucijų poreikiams, keičiant atskiras sistemos dalis. Institutas nurodo, kad šiuo metu vyksta pirmieji bandomieji diegimai, o demonstracinė versija apima tik dalį planuojamų funkcijų.

Kodėl deepfake aptikti taip sunku?

Didžiausias iššūkis, anot analitikų, yra mastas ir kaita: sukčiavimo kampanijos dažnai remiasi dešimtimis ar šimtais failų, kurie nuolat modifikuojami. Be to, pasitelkiamas vadinamasis cloaking, kai po reklamos publikavimo jos turinys pakeičiamas taip, kad moderavimo sistemoms būtų sunkiau susieti pradinę apgaulę su vėliau rodomu „padoriu“ turiniu.

Kita problema yra tai, kad kai kuriose turinio generavimo priemonėse pakanka formaliai patvirtinti teisę naudoti viešo asmens atvaizdą ar balsą. Tai sudaro sąlygas greitai dauginti klastotes, o NASK teigimu, jų stebėsenose fiksuotas šimtų skirtingų tapatybių panaudojimas deepfake turiniui.

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *