Cum funcționează tehnologia din spatele avatarelor?
Google’s DeepMind a lansat o nouă funcționalitate a modelului Gemini, disponibilă de la 25 septembrie 2026, care permite utilizatorilor să vadă fie un avatar în stil deschis, fie o față fotorealistică care mișcă buzele în sincronie cu vorbirea generată de AI. Tehnologia a fost demonstrată într-un webcast live și permite alegerea între un personaj animat sau o semănătură umană realistă pentru a însoți Această adăugare se bazează pe capacitățile multimodale existente ale Gemini, care prelucrează deja text, imagini și video.
Culture picks
Ascensiunea iBeer și succesul timpuriu al iPhone-ului
Lenovo a ratat prima undă a lansărilor Google, dar un tablet 2-in-1 specific ar putea apărea în curând
Izolare fizică a modelelor de AI, propusă ca scut împotriva atacurilor
Comisia de Jocuri din Massachusetts verifică cum DraftKings și alte companii folosesc datele cliențilorPrin integrarea unui motor de sincronizare labial în timp real, sistemul mapează fonemele vorbite mișcărilor faciale, creând iluzia că avatarul vorbește în realitate. Inginerii DeepMind spune că scopul este să facă interacțiunile mai atractive, mai ales în educație, servicii clienți și divertisment.
Totuși, criticii avertizează că avatarele hiperrealiste pot aprofunda temerile legate de dezinformare, deoarece publicul ar putea avea dificultăți să diferențieze vorbirea AI de cea umană genuina.
Gemini folosește o rețea generativă adversarială antrenată pe milioane de imagini faciale pentru a produce atât caractere în stil deschis, cât și fețe umane cu detalii ridicate. Când un utilizator inițiază o conversație, modelul generează mai întâi un Acestor le furnizează indicatori de timp motorului de avatar, care animă fața aleasă în timp real.
Aisha Patel, cercetătoare lideră la DeepMind, a explicat: „Pipeline-ul nostru sincronizează semnalele vocale și vizuale în sub 30 milisecunde, astfel încât mișcările buzelor avatarului să pară naturale ochiului uman.” Sistemul ajustează și expresiile – ridicând broșele sau zâmbând – pentru să se potrivească tonului Riscuri etice și potențial
Lansarea a generat debat între eticieni și decizieni politici.
Ce trebuie să știi despre avatarele Gemini?
Un studiu recent al Institutului pentru Cred Digital a révélat că spectatorii consideră avatarele AI fotorealiste cu 45 % mai încrezătoare decât un „Când un avatar arată și sună ca un om, oamenii scad garda,” a spus eticianul Marco Liu. Frământarea este că actorii răi ar putea arma tehnologia pentru scamuri tip deep-fake, propaganda politică sau asistență virtuală frauduloasă.
DeepMind recognize riscul și spune că va incorpora semnături invizibile și jurnalize de utilizare în toate fluxurile de avatar, dar criticii arguie că măsurile tehnice singure pot să nu fie suficiente.
Pe măsură ce funcționalitatea avatarelor devine disponibilă pentru clienți enterprise, impactul va probabil se întinde în sectoarele care se bazează pe asistenți digitali. Educații pot folosi avatarele animate pentru a ține copiii implicați, în timp ce bănci ar putea implementa fețe realistă pentru a personaliza cașierii virtuali. Dublă natura tehnologiei – care îmbunătățește experiența utilizatorului în același timp ce ridică riscul de dezinformare – înseamnă că regulatorii vor avea de elaborat ghiduri care să echilibreze inovația cu siguranța publică.
Cum asigură Gemini că mișcările buzelor avatarului corespund textului generat? Sistemul extrage fonemele din textul generat și le aliniază cu un model de sincronizare labial antrenat anterior, atingând o sincronizare în câțiva milisecunde.
Pot utilizatorii personaliza aparența avatarului? Da, Gemini oferă o bibliotecă de caractere animate și o selecție de fețe fotorealiste, cu opțiuni pentru ajustarea tonului de păr, stilul părului și accesorioarelor.
Ce măsuri de prevenire sunt în vigoare pentru a evita abuzul? DeepMind încorporează semnături invizibile în fluxul video și înregistrează metadatele de utilizare, permițând platformelor să verifice că avatarul este generat de AI.
