Claude Mythos a fost confirmat prin teste ca lider în descoperirea vulnerabilităților, însă el demonstrează și alte dezavantaje.
Rezumat scurt
Compania XBOW a efectuat o evaluare independentă a modelului AI Mythos Preview de la Anthropic. Rezultatele au arătat că modelul depășește modelele existente în identificarea vulnerabilităților codului sursă și în lucrul cu cod nativ și reverse engineering, dar prezintă slăbiciuni în analiza codului izolat și confirmarea aplicabilității practice a exploatărilor găsite. Costul funcționării modelului rămâne o problemă: Mythos este mai scump decât Opus, însă la un buget limitat de tokeni uneori demonstrează precizie superioară.
1. Ce verificase XBOW
- Volumul testelor – o serie de experimente independente asupra Mythos Preview.
- Scenarii – auditul sistemelor funcționale cu acces la cod sursă, analiza codului izolat, reverse engineering și interacțiunea cu interfața grafică.
2. Concluzii cheie
Indicator | Mythos Preview | Modele opuse
---|---|---
Detectarea vulnerabilităților | Cel mai bun indicator dintre toate modelele, în special în cod sursă și programare nativă | Mai puțin precis, dar uneori mai fiabil la verificarea cazurilor concrete
Reducerea falselor pozitive | Elimină mai multe „descoperiri” false decât predecesorii | Frecvent generează mai multe alarme false
Probleme în cod izolat | Modelul se descurcă mai puțin bine fără contextul sistemului | Unele modele funcționează mai bine cu analiza linie pe linie
Confirmarea exploatărilor | Tende să abordeze literal, uneori supraestimează valoarea practică a descoperirilor | Mai critică față de aplicabilitatea reală
Reverse engineering și cod nativ | Rezultate puternice; „înțelege” logica programului fără cod sursă | Mai puțină precizie în aceste sarcini
Interacțiune cu UI | Nu găsește întotdeauna coordonatele elementelor, dar identifică cu succes acțiunile necesare în browser | Unele modele sunt mai precise în poziționare
3. Cost și eficiență
- Prețuri – Anthropic a declarat că Mythos va costa cinci ori mai mult decât Opus.
- Analiză economică – XBOW a efectuat experimente cu modele „ieftine”, oferindu-le mai mult timp de lucru. Rezultatele au arătat că, la normalizarea pe cost, activitatea Mythos Preview nu pare extravagantă pentru sarcinile de precizie înaltă.
- Benchmark-uri – La un buget fix de tokeni, Mythos depășește Opus 4.6 în căutarea vulnerabilităților web, dar rămâne sub GPT5.5.
4. Concluzie
Mythos Preview demonstrează o putere excepțională la auditul codului sursă și al programelor native, precum și în sarcinile de reverse engineering și analiză a aplicațiilor web. Totuși, modelul uneori subestimează aplicabilitatea reală a vulnerabilităților găsite și prezintă slăbiciuni în analiza izolată a codului. La resurse limitate de tokeni, Mythos poate fi mai avantajos decât Opus, dar la buget complet, GPT5.5 rămâne competitor.
Concluzia XBOW: Mythos Preview este un instrument fiabil pentru identificarea potențialelor vulnerabilități în codul sursă și în sisteme complexe, dar necesită confirmare suplimentară a valorii practice a exploatărilor descoperite.
Comentarii (0)
Împărtășește-ți opinia — te rugăm să fii politicos și să rămâi la subiect.
Autentifică-te pentru a comenta