Microsoft‑cercetătorii susțin că modelele de inteligență artificială încă nu pot rezolva probleme complexe.

Microsoft‑cercetătorii susțin că modelele de inteligență artificială încă nu pot rezolva probleme complexe.

21 hardware

Microsoft‑cercetătorii au identificat limitările modelelor lingvistice mari (LLM) moderne în îndeplinirea sarcinilor complexe repetitive

În cadrul experimentelor Microsoft Research a descoperit că chiar și cele mai avansate modele AI fac greșeli serioase atunci când li se solicită să execute operațiuni lungi și multi-etape. Printre sistemele testate — Gemini 3.1 Pro, Claude 4.6 Opus și GPT 5.4 — fiecare a pierdut în medie aproximativ 25 % din conținutul documentelor după procesarea autonomă.

Ce s-a testat
* Benchmark DELEGATE‑52

Creat de echipa lui Philip Laban, Tobias Schnabel și Jennifer Neville. Acesta modelează fluxurile de lucru în 52 de domenii profesionale: de la programare și notare muzicală până la cristalografie.

* Criteriul de evaluare

Modelele au fost evaluate după cât de bine păstrează integritatea documentului după 20 de cicluri de procesare. Pragul „pregătire” a fost stabilit la 98 % – dacă rezultatul scădea sub această valoare, sarcina era considerată eșuată.

Concluzii principale
Domeniu Cele mai bune rezultate Programare Cele mai puternice performanțe Limbaj natural Modele cele mai puțin fiabile
* Scăderea calității

În peste 80 % dintre combinațiile de documente, calitatea a scăzut la 80 % și sub. Cel mai bun model (Gemini 3.1 Pro) îndeplinea criteriile de pregătire doar în 11 din 52 domenii.

* Erori „salt”

Pierderile nu se producau treptat, ci „în salturi”: într-un singur ciclu de interacțiune modelul putea pierde între 10 și 30 % din precizie. Modelele mai avansate (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) încercau să evite erorile minore, amânându-le procesarea la etape ulterioare și reducând numărul de interacțiuni.

* Managementul agenților

Utilizarea instrumentelor în modul de management al agenților nu a îmbunătățit rezultatele: până la sfârșitul ciclului calitatea scădea aproximativ cu 6 %.

Ce înseamnă pentru utilizatori
Cercetătorii subliniază că utilizatorii trebuie să controleze atent activitatea sistemelor AI atunci când le delegă autoritate. Modelele actuale pot funcționa autonom doar în domenii restrânse.

Cu toate acestea, autorii benchmark-ului menționează un progres semnificativ: familia de modele OpenAI a îmbunătățit performanța de la 14,7 % la 71,5 % în 16 luni. Acest lucru confirmă că LLM continuă să evolueze, dar încă rămân limitate în sarcinile complexe repetitive.

Comentarii (0)

Împărtășește-ți opinia — te rugăm să fii politicos și să rămâi la subiect.

Încă nu există comentarii. Lasă un comentariu și împărtășește-ți opinia!

Pentru a lăsa un comentariu, autentifică-te.

Autentifică-te pentru a comenta