ȘtiriTech&IT

Un test de performanță a comparat scrierile creative a 24 de modele LLM, relevând un nivel alarmant de amatorism

Dacă te bazezi pe ajutorul modelor LLM pentru a-ți accelera procesele creative, află că rezultatele ar putea să nu păcălească multă lume, cel mai recent benchmark pentru scriere creativă publicat de Vulsar AI demonstrând că până și cele mai avansate modele Frontier reușesc să depășească nivelul unui scriitor amator.

Vulsar AI a pus scriitorii umani în fața a 24 de LLM-uri pe baza a 475 de solicitări, rezultatele obținute demonstrând o diferență majoră de competențe. Testul conceput pentru a evalua performanța diverselor masterate în scriere creativă în raport cu scriitorii umani, atât amatori, cât și profesioniști, demonstrează că folosirea inteligenței artificiale nu duce automat la rezultate mai bune, însă funcționează de minune ca un mecanism de „cimentare” a mediocrității prin generarea de scrieri care împrumută din experiența autorilor anteriori, ale căror texte au fost incluse în baza de cunoștințe folosită pentru antrenarea respectivului LLM. Mai mult decât atât, doar cele mai avansate (și costititoare) modelele Frontier pot folosi acele experiențe suficient de bine pentru a genera rezultate care depășesc cu greu nivelul de amator.

Concluziile publicate de Vulsar AI contrazic în mod flagrant așteptările ridicate de „experții”, susținători ai industriei AI, care prevesteau noile modele LLM vor prelua fără drept de apel tot felul domenii și profesii care implică scrierea creativă. Cu toate acestea, pe baza a 475 de solicitări, noul benchmark arată că doar modelele de frontieră pot depăși oamenii în această privință, și anume scriitorii amatori, nu și cei profesioniști.

Doar GPT 6 Astra poate depăși ușor nivelul unui scriitor amator

Benchmark-ul realizat de Vulsar AI evaluează performanțele autorilor LLM la generarea de texte lungi. Proiectul a folosit un model de recompensă ajustat pe baza datelor privind preferințele umane pentru a prezice reacția generală a cititorilor. Conform clasamentului rezultat, GPT 6 Astra conduce cu o rată de câștig prezisă de 87,8%, depășind scriitorii umani, care au obținut o rată de câștig prezisă de 86,6%. Pe de altă parte, diferența de competențe dintre scriitorii umani amatori și scriitorii umani profesioniști este masivă.

Totuși, chiar dacă modelele de frontieră precum GPT 6 Astra reușesc uneori să depășească scriitorii amatori, persoanele profesioniste obțin în continuare scoruri vizibil mai mari atunci când sunt evaluate separat. Pe locul al treilea, GPT 5.6 Sol de la OpenAI a obținut o rată de câștig prezisă de 77,6%, în timp ce Claude Fable 5.1 de la Anthropic a obținut o rată de câștig prezisă de 70,3%. Cu toate acestea, există o scădere masivă a scorurilor odată ce ne îndepărtăm de modelele AI cu trilioane de parametri.

Astfel, dacă apelezi la soluții „low cost” pentru generarea de scrieri creative, de exemplu Claude Opus 5, Kimi K3, Grok 4.6 și altele, nivelul de aprobare a rezultatelor obținute scade la 50-65%. Modelele mai puțin dense produc rezultate și mai slabe, modelele LLM populare precum Qwen3.8-27B atingând 23,2%, DeepSeek V4.1 Flash înregistrând 19,8%, iar Gemma 4 26B la baza clasamentului, cu un scor de doar 10,9%.

Scriitorii umani nu numai că pot menține o poveste complexă, dar gândirea lor spontană le permite și să își schimbe stilul și randamentul din mers. În schimb, cu cât sunt mai simple, cu atât LLM-urile tind să-și piardă mai rapid coerența în cazul prompt-urilor cu mai multe capitole, generând fraze repetitive, pe care scriitorii umani le-ar sesiza și evita fără probleme.

Autor

  • Aurelian Mihai

    Îmi place să fiu la curent cu ultimele inovații și gadgeturi high-tech. Când nu scriu articole pentru Zona IT, îmi ocup timpul cu seriale SF, documentare sau periind internetul după tot felul de știri sau informații care-mi captează atenția. În weekend mă găsești cu bicicleta în parc sau colindând prin țară cu familia.

Back to top button