Tag: Recenzavimas

  • DI peržiūrėjo mokslą ir duomenų bazes: aptiko dešimtmečių klaidas, mastas pribloškia

    DI peržiūrėjo mokslą ir duomenų bazes: aptiko dešimtmečių klaidas, mastas pribloškia

    Didieji kalbos modeliai ir vadinamieji skaitmeniniai bendraautoriai vis dažniau pasitelkiami moksle, kai reikia suformuluoti hipotezes, rašyti kodą ar parengti rankraščius. Tačiau kartu ryškėja nauja problema: publikacijų ir duomenų kiekis auga taip greitai, kad tradicinis žmonių recenzavimo procesas vis dažniau nespėja užtikrinti kokybės.

    Dėl to mokslininkai vis dažniau bando patį tikrinimą automatizuoti, pasitelkdami DI agentus, kurie išskiria autorių teiginius, surenka papildomą medžiagą ir mėgina atkartoti eksperimentus. Tokie bandymai rodo ne tik pavienes klaidas, bet ir sistemines spragas, kurios ilgus metus galėjo likti nepastebėtos.

    Klaidos rastos net senose bazėse

    Vienas ryškiausių pavyzdžių fiksuotas chemijos srityje, kur dešimtmečiais buvo remiamasi etaloninėmis virimo temperatūrų lentelėmis. DI modelio ir vėlesnės rankinės patikros derinys atskleidė, kad dalis įrašų patikimoje, apie 75 metus pildytoje referencinėje bazėje buvo netikslūs.

    Zhejiang laboratorijoje Hangdžou dirbantis Sebastianas Pios, prognozuodamas molekulių parametrus, pastebėjo nesutapimus ir juos patikrino literatūroje. Paaiškėjo, kad kai kur klaidas lėmė spausdinimo netikslumai, o kitur buvo kartojami pasenę, dar prieš šimtmetį atliktų matavimų duomenys.

    Bandant atkartoti teiginius, rezultatai prasti

    Kitas pavyzdys susijęs su bandymais automatiškai vertinti konferencijoms teikiamus straipsnius. Analitikai iš SAI Labs pasitelkė DI agentus 168 darbams, atrinktiems konferencijai ICML 2026 metais, o autonominės sistemos mėgino ištraukti patikrinamus teiginius ir atkurti eksperimentų rezultatus.

    Iš 92 straipsnių, kuriuose buvo bent 5 patikrinami teiginiai, algoritmams pavyko atkurti daugiau nei 2 teiginius tik 34 atvejais. Daugiau nei 80 proc. teiginių buvo sėkmingai pakartota tik 8 darbuose, o tai rodo, kad vadinamasis replikacijos krizės klausimas aktualus ne vien socialiniuose moksluose.

    Klaidos auga, bet DI nėra teisėjas

    Stanfordo universiteto tyrimas, kuriam vadovavo Jamesas Zou, parodė, kad NeurIPS konferencijų publikacijose vidutinis objektyvių klaidų skaičius išaugo nuo 3,8 2021 metais iki 5,9 2025 metais, tai yra 55 proc. daugiau. Analizė apėmė formulių, skaičiavimų ir grafikų klaidas, nevertinant interpretacijų ar mokslinės naujovės.

    „Didžiausias pokytis yra galimybė tai daryti mastu, kuris anksčiau buvo neįmanomas“, – sakė Jamesas Zou.

    „DI neturėtų daryti visko, o sprendimus dėl naujumo ir reikšmės reikia palikti žmonėms“, – sakė Federico Bianchi iš „Together AI“.

    Ekspertai pabrėžia, kad automatiniai įrankiai gali būti naudingi kaip papildoma patikra prieš pateikiant darbą recenzijai, tačiau jie klysta ir gali generuoti klaidingus pavojaus signalus. Norvegijos mokslo ir technologijų universiteto mokslininkas Odd Eirik Gundersen akcentuoja, kad tokios sistemos daro klaidų panašiai kaip žmonės, todėl privaloma tyrėjų priežiūra.

    Apklausose dalis autorių pripažįsta, kad automatinė grįžtamoji informacija padėjo rasti klaidų ir paskatino papildomus eksperimentus, tačiau tuo pat metu tyrimai rodo ribotą DI efektyvumą lyginant su žmonių recenzentais. Dėl to vis dažniau pabrėžiama, kad patikimiausias kelias yra mišrus modelis, kai DI padeda aptikti technines spragas, o galutinį sprendimą priima srities ekspertai.

  • Biomedicinos straipsniuose plinta fiktyvios citatos: auditas rodo šuolį po „ChatGPT“ bangos

    Biomedicinos straipsniuose plinta fiktyvios citatos: auditas rodo šuolį po „ChatGPT“ bangos

    Didelės apimties biomedicinos publikacijų auditas atskleidė sparčiai augantį fiktyvių citatų ir neegzistuojančių šaltinių skaičių recenzuojamoje literatūroje. Tyrėjai įspėja, kad toks reiškinys ne tik gilina pasitikėjimo mokslu krizę, bet ir gali turėti tiesioginių pasekmių pacientų saugumui, jei klaidingos nuorodos vėliau patenka į klinikines rekomendacijas.

    Audite analizuotos PubMed Central bazėje publikuotos biomedicinos studijos, o jų literatūros sąrašai tikrinti keliose plačiai naudojamose bibliografinėse duomenų bazėse. Komanda, vadovaujama Kolumbijos universiteto tyrėjo Maximo Topazo, automatizuotu būdu atrinko tūkstančius įtartinų atvejų ir vėliau vertino, ar nurodomi šaltiniai iš tiesų egzistuoja.

    Fiktyvios nuorodos – vis dažnesnės

    Tyrėjų sukurta sistema publikacijose aptiko 2 810 straipsnių, kuriuose iš viso buvo 4 046 įtariamai suklastotos nuorodos. Šaltiniai laikyti fiktyviais tuomet, kai jų nepavyko rasti nė vienoje iš kelių pagrindinių paieškos ir registrų sistemų, naudojamų akademinėms publikacijoms identifikuoti.

    Skaičiai rodo ryškų augimą nuo 2023 metų. Jei 2023 metais bent vieną fiktyvią citatą turėjo maždaug vienas iš 2 828 straipsnių, tai 2026 metų pradžioje šis rodiklis priartėjo prie vieno iš 277, vadinasi, dažnis padidėjo daugiau nei 12 kartų.

    Tyrėjai pabrėžia, kad aptikti atvejai gali būti tik apatinė ribinė reikšmė, nes automatizuota patikra neišgaudo visų galimų manipuliacijų. Dalis fiktyvių nuorodų gali būti sukonstruotos taip, kad atrodytų kaip tikri įrašai, tačiau klaidingai nurodo autorius, metus ar žurnalo duomenis.

    Ryšys su DI – tikėtinas

    Staigus augimas sutampa su generatyvinių DI įrankių paplitimu, kai tekstų kūrimo sistemos tapo plačiai prieinamos akademinei bendruomenei. Tyrėjai neatmeta, kad dalis autorių, rengdami literatūros apžvalgas ar įvadines dalis, galėjo pasikliauti DI sugeneruotomis nuorodomis, jų nepatikrindami.

    „Tai, ką aptikome, greičiausiai tėra apatinė tikrojo paplitimo riba, nes kol kas palietėme tik ledkalnio viršūnę“, – sakė Maxim Topaz.

    Publikavimo ciklas gali paaiškinti, kodėl šuolis ryškiau matomas po 2023 metų, o ne iškart po 2022 metų pabaigoje prasidėjusio masinio įrankių įsisavinimo. Nuo straipsnio pateikimo iki pasirodymo žurnale dažnai praeina keli mėnesiai ar daugiau, nes tekstas pereina recenzavimo procesą.

    Kodėl recenzija to nesustabdo?

    Auditas parodė, kad recenzavimo praktika ne visada pajėgia atpažinti suklastotas nuorodas, nes jos gali atrodyti įtikinamai. Tokios citatos dažnai būna formaliai taisyklingos, pritaikytos straipsnio temai, su realistiškais autoriais ir datomis, todėl jas sudėtinga iškart pastebėti net patyrusiems recenzentams.

    Tyrėjų duomenimis, fiktyvios nuorodos dažniau aptinkamos apžvalginiuose straipsniuose nei kituose darbuose, o tai ypač svarbu, nes apžvalgos ir sisteminės apžvalgos daro didelę įtaką tolesniems tyrimams ir rekomendacijoms. Tarp aptiktų atvejų buvo ir klinikinių tyrimų bei sisteminių apžvalgų, kurios gali tiesiogiai formuoti gydymo praktikos kryptis.

    Didžiausia rizika kyla tuomet, kai klaidingos nuorodos pradeda būti cituojamos kituose darbuose, taip tarsi suteikdamos fikcijai patikimumo. Ilgainiui, kai publikacija įgauna daug citatų, pirminių šaltinių niekas nebetikrina, o neteisinga informacija gali įsitvirtinti kaip tariamas mokslo konsensusas.

    Audito autoriai taip pat atkreipė dėmesį į leidėjų reakcijos trūkumą. Dauguma identifikuotų straipsnių nesulaukė nei pataisymų, nei aiškių pastabų, o atšaukimų dalis buvo labai maža, ir ne visada susijusi būtent su fiktyviomis citatomis.

    Sprendimu siūloma sisteminė prevencija: leidėjams ir redakcijoms įdiegti automatizuotą citatų patikrą dar prieš recenzavimą, kai straipsnis pateikiamas vertinimui. Tyrėjų teigimu, toks žingsnis galėtų užkirsti kelią klaidingoms nuorodoms patekti į mokslinę apyvartą ir vėliau daryti įtaką medicinos sprendimams.

    Tyrėjai pabrėžia, kad ši analizė neapėmė nerecenzuojamos vadinamosios pilkosios literatūros ir kitų internetinių publikavimo kanalų, kur kontrolė dar silpnesnė. Tai reiškia, kad bendras fiktyvių citatų mastas už recenzuojamų žurnalų ribų gali būti dar didesnis.