Gemini 3.1 Flash Live: modelul vocal Google care aude mai bine prin zgomot
Traficul, televizorul din fundal, un copil care plânge: problema de zi cu zi a oricărui agent vocal. Google spune că noul model o rezolvă mai bine.
Echipa Vocalyy3 min de citit
Ce este Gemini 3.1 Flash Live
Pe 26 martie 2026, Google a prezentat Gemini 3.1 Flash Live drept cel mai bun model audio și vocal al său de până acum. E un model care primește sunet și răspunde cu sunet, fără să treacă prin text la fiecare pas, și e gândit pentru dialog în timp real.
Modelul alimentează Gemini Live și Search Live pentru utilizatorii obișnuiți, iar companiile îl pot folosi prin Gemini Live API (în previzualizare, în Google AI Studio) și prin oferta Google pentru relații cu clienții. Potrivit Google, companii ca Verizon și The Home Depot l-au testat înainte de lansare.
Zgomotul de fundal, problema de zi cu zi
Oricine a ascultat înregistrări de apeluri reale știe că un client rar sună din liniște. Sună din mașină, de pe stradă, din bucătărie, cu televizorul pornit. Pentru un agent vocal, o frază prinsă de la televizor poate deveni o „cerere” a clientului.
Google spune că noul model deosebește mai bine vorbirea relevantă de sunetele din mediu, filtrează mai eficient zgomotul și recunoaște mai bine nuanțele acustice, ca tonul și ritmul vorbirii. Compania mai spune că răspunde mai repede decât generația anterioară și că Gemini Live poate ține minte o conversație de două ori mai lungă.
90+
limbi în care modelul poate purta o conversație în timp real
Acțiuni în timpul apelului, nu doar răspunsuri
Un agent vocal util nu doar vorbește. Verifică un calendar, caută o comandă, scrie un rând într-un tabel. În limbajul tehnic, astea sunt „apeluri de funcții”. Pe ComplexFuncBench Audio, un test cu sarcini de acest fel în mai mulți pași, făcute prin voce, Google raportează un scor de 90,8%.
Același anunț arată și unde e încă greu. Pe Audio MultiChallenge, un test construit de Scale AI din vorbire umană reală, cu ezitări și autocorecturi, modelul a obținut 36,1% cu funcția de „gândire” pornită. Cu alte cuvinte, conversațiile lungi și dezordonate rămân dificile pentru orice model.
SynthID și transparența
Tot sunetul generat de Gemini 3.1 Flash Live conține un marcaj SynthID, integrat în sunet astfel încât urechea nu îl aude, dar poate fi detectat. Scopul declarat e să se poată identifica vocea generată de AI și să se reducă riscul de dezinformare.
Am explicat regulile în articolul despre AI Act și agenții vocali.
Ce înseamnă pentru afacerea ta
Dacă clienții tăi sună des din zgomot (livrări, service auto, restaurante, clinici cu sală de așteptare), testează agentul exact în condițiile astea înainte să-l pornești:
- un apel dintr-o mașină în mers;
- un apel cu televizorul sau radioul pornit;
- un client care vorbește cu altcineva în timpul apelului.
Un agent bun trebuie să ceară o confirmare atunci când nu e sigur, nu să ghicească. Vezi cum testăm un agent înainte de lansare.
Surse
- 1.Gemini 3.1 Flash Live: Google's latest AI audio modelGoogle, 26 martie 2026
- 2.Gemini Live gets its 'biggest upgrade yet' with Gemini 3.1 Flash Live9to5Google, 26 martie 2026
- 3.Gemini 3.1 Flash Audio: model cardGoogle DeepMind, 2026
Articol scris de echipa Vocalyy pe baza surselor de mai sus. Cifrele și declarațiile le aparțin autorilor citați.