ChatGPT, testat de o nouă cercetare: Erori frecvente în evaluarea științifică Un studiu recent pune sub semnul întrebării acuratețea ChatGPT în evaluarea ipotezelor științifice
ChatGPT, testat de o nouă cercetare: Erori frecvente în evaluarea științifică
Un studiu recent pune sub semnul întrebării acuratețea ChatGPT în evaluarea ipotezelor științifice. Rezultatele, obținute după analizarea a sute de afirmații, indică o performanță mai degrabă modestă, cu o precizie care lasă de dorit, mai ales în identificarea afirmațiilor false. Cercetarea scoate la iveală limitele actuale ale inteligenței artificiale generatoare, subliniind importanța unei abordări critice în utilizarea acesteia.
Acuratețe sub așteptări, chiar și în testele ulterioare
În cadrul studiului, cercetătorii au solicitat ChatGPT să evalueze peste 700 de ipoteze științifice, punând aceeași întrebare de 10 ori pentru fiecare dintre acestea. Scopul a fost de a măsura consistența răspunsurilor. Prima dată testat în 2024, modelul lingvistic a demonstrat o acuratețe de 76,5%. Într-un test de urmărire din 2025, precizia a crescut ușor, ajungând la 80%. Totuși, ajustarea rezultatelor pentru a exclude ghicirea aleatorie a dezvăluit o imagine mai puțin favorabilă. Performanța modelului a fost cu doar 60% mai bună decât șansa, sugerând mai degrabă un nivel apropiat de un „D” scăzut, decât de o fiabilitate ridicată.
Inconsistențe și dificultăți în identificarea afirmațiilor false
O altă constatare îngrijorătoare a studiului este dată de inconsistenta răspunsurilor furnizate de ChatGPT. Chiar și atunci când a fost confruntat cu aceeași întrebare de 10 ori consecutiv, modelul a oferit răspunsuri consistente în doar 73% din cazuri. „Nu vorbim doar despre acuratețe, vorbim despre inconsistență, pentru că dacă pui aceeași întrebare iar și iar, obții răspunsuri diferite”, a declarat Cicek, profesor asociat la Departamentul de Marketing și Afaceri Internaționale din cadrul Carson College of Business al WSU și autor principal al publicației. Sistemul IA de asemenea a avut dificultăți în identificarea afirmațiilor false, etichetându-le corect doar în 16,4% din cazuri.
Aceste rezultate subliniază necesitatea unei abordări prudente în utilizarea inteligenței artificiale pentru luarea deciziilor importante, mai ales în domenii care necesită o înțelegere profundă și nuanțată. Potrivit studiului, liderii de afaceri ar trebui să verifice informațiile generate de IA cu scepticism și să investească în formarea personalului pentru a înțelege mai bine capacitățile și limitele acestor sisteme. Cercetările viitoare vor explora performanța altor modele lingvistice, pentru a oferi o imagine completă a domeniului.
Sursa: G4Media