Dirbtinis intelektas vis geriau supranta, ką pasakome žodžiais, tačiau kasdienėje komunikacijoje lemiamą dalį sudaro tonas, pauzės, veido mimikos ir kūno kalba. Šie signalai dažnai nulemia, ar pašnekovas pasitiki, sutinka, dvejoja ar yra sutrikęs, tačiau daugumai šiandienos DI sistemų jie vis dar lieka sunkiai „matomi“.
Kopenhagoje veikiantis startuolis „Interhuman AI“ siekia tą spragą užpildyti kurdamas socialinio intelekto technologiją. Įmonė pristatė naujausią savo modelį „Inter-2“, kuris realiu laiku analizuoja socialinius signalus tekste, garse ir vaizde, kad DI galėtų reaguoti ne tik į žodžius, bet ir į žmogų.
Pasak komandos, „Inter-2“ vienu metu vertina veido išraiškas, balso intonaciją, žvilgsnio krypties pokyčius, laikyseną ir galvos gestus. Taip aptinkama 12 signalų, tarp jų įsitraukimas, dvejonė, neužtikrintumas, sutrikimas, pritarimas ir nepritarimas.
Nuo kalbos modelių prie socialinių ženklų
„Interhuman AI“ bendraįkūrėjai Frederik Sally ir Paula Petcu teigia, kad idėja išryškėjo, kai plačiai paplito didieji kalbos modeliai ir pokalbių sistemos. Nors jos pakeitė sąveiką su technologijomis, jos menkai atsižvelgia į tai, kaip žmogus kalba, kokią emociją slepia ar kokį signalą siunčia pauzėmis.
„Iš čia ir kilo klausimas: ar galime sujungti kalbos modelius su vaizdo ir garso analize iš kameros bei mikrofono ir pridėti papildomą jutimo sluoksnį, kad suprastume, ką vartotojas iš tikrųjų komunikuoja?“, – sakė Paula Petcu.
Komanda pirmąjį prototipą kūrė kaip DI trenerį, kuris reaguotų į turinį ir pateikimo manierą. Toks principas vėliau išsivystė į platesnę kryptį, kurią įmonė vadina dirbtiniu socialiniu intelektu, kai sistema bando atkurti žmogui būdingą gebėjimą skaityti situacijos kontekstą.
Kur tai gali praversti?
Praktinių pritaikymų spektras platus: nuo įmonių mokymų iki sveikatos priežiūros. Pavyzdžiui, darbo pokalbiuose ar derybų treniruotėse DI galėtų pateikti ne tik teksto analizę, bet ir įžvalgas apie tai, kaip skamba kandidato atsakymai, ar kada jis pradeda dvejoti.
Skaitmeninėje sveikatoje socialiniai signalai svarbūs nuotolinėse konsultacijose ir pagalbos linijose, kur neteisingai suprastas stresas ar susierzinimas gali lemti netinkamus sprendimus. Kuriant robotiką ar pagalbinius asistentus, gebėjimas pastebėti nepritarimą ar diskomfortą tampa tiesiogiai susijęs su sauga.
„Šiandienos modeliai yra įspūdingai pajėgūs, bet socialiai kurti. Jie atsako į žodžius, o ne į žmogų, kuris juos parašė. Teisingas atsakymas, pateiktas netinkamu momentu, vis tiek yra blogas atsakymas“, – sakė Frederik Sally.
Duomenys, skaidrumas ir privatumo rizikos
Didžiausias iššūkis socialiniam DI yra tai, kad žmonių elgsena labai individuali: pauzė gali reikšti neužtikrintumą, bet gali reikšti ir apgalvojimą. Dėl to tokiems modeliams reikia itin įvairių duomenų ir kruopštaus anotavimo, kad sistema nepainiotų signalų skirtinguose kontekstuose.
„Interhuman AI“ teigia siekianti, kad išvados būtų atsekamos: naudotojas turėtų suprasti, kokie požymiai lėmė konkretų vertinimą. Toks skaidrumas ypač svarbus situacijose, kur sprendimai gali turėti pasekmių žmogaus karjerai, sveikatai ar paslaugų prieinamumui.
„Norime, kad būtų galima atsekti, kas lėmė, jog tam tikru momentu buvo atpažinta dvejonė. Jei DI sprendžia ką nors apie mano ateitį, noriu turėti galimybę tai kvestionuoti“, – sakė Frederik Sally.
Kartu daugėja ir rizikų: socialinių signalų atpažinimas gali būti panaudotas manipuliacijai, ypač jei technologija būtų pritaikoma realiame pasaulyje stebint nepažįstamus žmones. Įmonė teigia jau nubrėžusi tam tikras ribas, su kuo dirbtų, ir akcentuoja atitiktį BDAR bei saugumo auditų svarbą.
Europoje kuriami DI modeliai turi veikti griežtesnėje reguliavimo aplinkoje, o tai, startuolio vertinimu, gali tapti konkurenciniu pranašumu plečiantis į kitas rinkas. „Interhuman AI“ planuoja toliau plėsti modelių šeimą ir gerinti veikimą sudėtingesnėse situacijose, įskaitant balso kanalą be vaizdo bei kelių žmonių pokalbius.
