Xiaomi a lansat OmniVoice – o model AI deschis care poate vorbi texte în practic toate limbile și poate copia vocea.

Xiaomi a lansat OmniVoice – o model AI deschis care poate vorbi texte în practic toate limbile și poate copia vocea.

22 software

Xiaomi a prezentat modulul AI deschis OmniVoice

Compania a anunțat lansarea modelului de inteligență artificială OmniVoice, care transformă textul în vorbire. Pe lângă sinteza vocii în sute de limbi, modelul poate clona vocea și genera pronunție cu setări personalizate.

Ce este nou la OmniVoice?
IndicatorDescriereLimbiSuport pentru peste 200 de limbi, inclusiv cele rare și greu de antrenat. Chiar și cu mai puțin de 10 ore de date, modelul produce vorbire „aproape în orice limbă”.CalitateÎn teste pe 102 limbi, claritatea vorbirii a fost comparabilă cu cea umană și, în unele cazuri, a depășit-o. Pe 24 de limbi, modelul a depășit mai multe sisteme comerciale în ceea ce privește asemănarea și claritatea.ArhitecturăRețea simplificată bidirecțională Transformer fără module intermediare de previzionare a token-urilor. Aceasta reduce timpul de antrenament la o zi pentru 100.000 de ore de date și crește viteza inferenței (până la 40× în timp real în PyTorch).Tehnologii• „Ascundere aleatorie a codurilor acustice” – accelerează antrenamentul.• Conectarea unui model lingvistic mare în pre-antrenament îmbunătățește pronunția și claritatea.

Capabilități practice
1. Clonare vocală

- Generare de vorbire pe baza caracteristicilor descrise (vârstă, sex, ton, accent, dialect).

- Posibilitatea de a crea șoaptă și alte variante stilistice fără audio de referință.

2. Procesarea înregistrărilor originale

- Eliminarea zgomotului și extragerea caracteristicilor pure ale vocii chiar din fișiere imperfecte.

3. Controlul intonației

- Adăugarea suspine, râs și alte nuanțe pentru un sunet mai natural.

4. Corectare precisă a pronunției

- Ajustare manuală a sunetelor complexe, de exemplu caractere chinezene multifonemice sau nume proprii în limba engleză.

Concluzii
OmniVoice reprezintă o alternativă competitivă sistemelor comerciale existente de sinteză vocală. Datorită designului simplu, vitezei mari de antrenament și inferență, precum și a capacităților extinse de personalizare, modelul este pregătit pentru integrarea în aplicații și servicii consumer.

Comentarii (0)

Împărtășește-ți opinia — te rugăm să fii politicos și să rămâi la subiect.

Încă nu există comentarii. Lasă un comentariu și împărtășește-ți opinia!

Pentru a lăsa un comentariu, autentifică-te.

Autentifică-te pentru a comenta