Ce face MAI-Transcribe-2-Streaming?
În cadrul unei anunțări făcute joi, 1 octombrie 2026, Microsoft a lansat trei modele noi de inteligență artificială specializate în procesarea vocala în timp real. Instrumentele sunt gândite pentru a sprijini aplicații variate: agenți de servicii clienți, asistenți multilingvi, experiențe educațive interactive, subtitrarea live și interfețe controlate prin voce.
Culture picks
Zuckerberg respinge cooperarea în domeniul siguranței AI dintre giganții tehnologici
Spitalele și inteligența artificială: costuri în creștere, asigurătorii în alertă
Revoluție în sunet: Noul cip Qualcomm ar putea scoate Wi-Fi-ul din umbra Bluetooth
Qualcomm pregătește terenul pentru console portabile cu noul Snapdragon X2Conform blogului oficial al companiei, aceste inovații dau programatorilor mai multă flexibilitate în construirea de interacțiuni vocale naturale.
Primul instrument, MAI-Transcribe-2-Streaming, face transcrierea continuă a vorbirii în flux. Transformă sunetul în text imediat, în timp ce se pronunță, și funcționează în peste 60 de limbi.
Detectează automat limba și generează primele ipoteze în câteva sute de milisecunde, stabilizând transcriptul doar la sfârșitul enunțului.
Naomi Moneypenny, director senior la Microsoft Foundry Models, a explicat că această rapiditate permite aplicațiilor să reacționeze în timp real: un agent poate începe să înțeleagă cererea unui apelant încă vorbește acesta, iar un asistent vocal poate porni procesul de raționament mai repede.
O transcriere live arată cuvintele aproape imediat ce sunt spuse.
Al doilea model, MAI-Voice-2.1, este o soluție de sinteză a vorbirii din text, multilingvă și expresivă.
Cine este MAI-Voice-2?
Microsoft îl prezintă ca fiind cel mai expresiv din portofoliul său. Generează discursuri naturale și nuantate în 23 de limbi, ideal pentru scenarii în care calitatea vocii este esențială.
Al treilea instrument, MAI-Voice-2.1-Flash, este o versiune optimizată pentru viteză.
Suportă aceleași limbi și identități vocale ca și variantă standard, dar este gândită pentru situații în care timpul de Moneypenny a spus că dezvoltatorii pot alege MAI-Voice-2.1 când fidelitatea expresivă este prioritară, sau Flash când trebuie să echilibreze naturalitatea cu viteza și eficiența de cost la scară.
Lansarea se inscrie într-o strategie mai largă de investiții în AI. În iulie 2026, Microsoft a anunțat că va aloca 2,5 miliarde de dolari pentru a crea Microsoft Frontier Company, o nouă divizie destinată să ajute clienții să adopte eficient tehnologiile de AI.
Departamentul va integra 6.000 de experți și ingineri, care vor lucra direct lângă clienți — o abordare pe care Microsoft o descrie ca o evoluție a „ingineriei distribuite pe teren”.
Aceasta se aliniază cu datele PYMNTS din iulie, care arată că finanțarea în AI se concentrează tot mai mult pe sectorul enterprise, iar producătorii de modele luptă să ponteze gap-ul dintre ideea și implementarea în fluxurile corporative.
Cu aceste modele vocale în timp real, Microsoft consolidează poziția pe piața centrelor de contact, oferind soluții pentru o comunicare mai fluidă între mașini și oameni.

