Xiaomi a dezvoltat un model AI cu 4,7 miliarde de parametri, care combină percepția vizuală, vorbirea și controlul pentru roboți.
Xiaomi intră pe piața roboticii
Gigantul chinez de dispozitive mobile și casă inteligentă, cunoscut sub numele de Xiaomi, a anunțat un nou pas: dezvoltarea propriei modele de inteligență artificială pentru roboți. Compania a prezentat Xiaomi‑Robotics‑0, o sistem cu cod sursă deschis care combină recunoașterea vizuală, înțelegerea limbajului și controlul acțiunilor în timp real. Modelul are 4,7 miliarde de parametri și a stabilit deja mai multe recorduri atât în simulări, cât și în practică.
Cum funcționează modelul
Robotul trece de obicei prin ciclul „percepție → decizie → acțiune”. Xiaomi‑Robotics‑0 echilibrează înțelegerea largă a situației cu controlul precis al motorizării datorită arhitecturii Mixture‑of‑Transformers (MoT).
1. Model vizual-lingvistic (VLM) – „creierul” sistemului.
* Învață să interpreteze comenzile, chiar și neclare („te rog, pliază prosopul”).
* Înțelege relațiile spațiale pe baza imaginilor de înaltă calitate.
* Sarcini: detectarea obiectelor, răspunsuri la întrebări vizuale și raționament logic.
2. Expert în acțiuni (Action Expert) – generator de mișcări.
* Bazat pe un transformator de difuzie (DiT).
* Nu generează o singură acțiune odată; formează o secvență de acțiuni prin potrivirea fluxurilor, asigurând fluiditate și precizie.
Învățare fără pierderea înțelegerii
VLM-urile obișnuite își pierd o parte din abilitățile de percepție atunci când sunt antrenate pe sarcini fizice. Xiaomi a rezolvat această problemă, antrenând simultan modelul cu date multimodale (imagini + text) și date despre acțiuni. Procesul de învățare constă într-o serie de etape:
1. Propunerea acțiunilor – VLM prezice distribuțiile posibile de acțiuni pe imagini, sincronizând reprezentarea internă cu operațiile reale.
2. După aceea, VLM „se dezactivează”, iar DiT urmează un antrenament separat pentru generarea secvențelor exacte din zgomot, bazându-se pe semnalele cheie, nu pe tokeni de limbaj.
Minimizarea întârzierilor
Pentru a elimina pauzele dintre previziunile modelului și mișcările reale ale robotului, se utilizează livrarea asincronă: calculele AI și acțiunile robotului sunt separate. Acest lucru permite roboților să se miște continuu chiar și atunci când este necesar un calcul suplimentar.
* Clean Action Prefix – metodă de revenire la o acțiune anterioară prevăzută, asigurând fluiditate fără șocuri.
* Masca atenției se concentrează pe secvența vizuală curentă, ignorând stările trecute, ceea ce face robotul mai receptiv la schimbări bruște ale mediului.
Rezultate
În mediile de simulare LIBERO, CALVIN și SimplerEnv, Xiaomi‑Robotics‑0 a depășit aproximativ 30 de concurenți. Pe un robot real cu două manipulatoare, modelul a reușit să execute sarcini complexe: plierea prosopelor, demontarea unui constructor. Robotul a demonstrat o coordonare stabilă între mâini și ochi, manipulând obiectele în mod eficient în diferite scenarii.
Astfel, Xiaomi nu numai că și-a extins portofoliul de produse, dar a pus bazele pentru cercetări viitoare în domeniul „inteligenței fizice” a roboților.
Comentarii (0)
Împărtășește-ți opinia — te rugăm să fii politicos și să rămâi la subiect.
Autentifică-te pentru a comenta