Microsoft ha alzato ulteriormente l'asticella nella corsa ai modelli vocali: il 1° ottobre 2026 Microsoft AI ha presentato MAI-Transcribe-2-Streaming, il suo primo modello di trascrizione pensato specificamente per il tempo reale, accompagnato da due aggiornamenti dei modelli di sintesi vocale, MAI-Voice-2.1 e MAI-Voice-2.1-Flash. Non è un annuncio isolato: completa la pipeline che Microsoft sta costruendo per gli agenti vocali aziendali, dalla voce in ingresso al testo, dal testo elaborato dai modelli linguistici alla voce sintetica in uscita, il tutto pensato per girare su Microsoft Foundry e Azure.
Trascrivere il parlato mentre viene pronunciato, non dopo
Il predecessore MAI-Transcribe-2, lanciato a settembre come modello "batch", è pensato per trascrivere registrazioni già completate: riconosce 60 lingue, distingue i diversi interlocutori (diarizzazione), aggiunge timestamp parola per parola e gestisce il code-switching, cioè il passaggio naturale tra due lingue nella stessa frase, tipico di chi parla hinglish o spanglish. La novità di inizio ottobre è la sua "versione gemella" pensata per lo streaming: elabora l'audio man mano che viene pronunciato e restituisce il testo con una latenza di appena 0,12-0,13 secondi dal termine del parlato, circa il doppio più rapida, secondo i dati diffusi da Microsoft, del concorrente più vicino. Sul benchmark indipendente Artificial Analysis, che misura l'accuratezza in tempo reale (AA-WER Streaming Index) su un campione di circa otto ore di audio tratte da conversazioni con agenti, discorsi del Parlamento europeo e trascrizioni di bilanci aziendali, il modello si è classificato primo su 38 concorrenti con un tasso di errore sulle parole del 2,5%, davanti a Grok Voice Transcribe 2.0 di xAI (2,7%, ma con latenza più che tripla) e a Gemini 3.5 Transcribe Live di Google (4%).
Prezzo introduttivo e modalità di accesso
Il prezzo di lancio è di 0,54 dollari per ora di audio trascritto (equivalenti a 9 dollari ogni 1.000 minuti), una tariffa temporanea valida fino alla fine del 2026 e più alta di quella praticata da xAI e Meta per i rispettivi modelli di streaming, a fronte però di un'accuratezza superiore secondo i dati pubblicati. Il modello è proprietario, senza pesi apribili, e si può usare tramite un'API in tempo reale compatibile con il protocollo WebSocket già adottato da OpenAI, tramite Azure Speech SDK, nel MAI Playground, su Vercel e nella funzionalità Azure Voice Live; il supporto per LiveKit, infrastruttura open source molto diffusa per costruire agenti vocali, è annunciato come "in arrivo". Al momento il servizio è in anteprima pubblica, senza garanzie contrattuali di livello di servizio (SLA).
Accanto al modello di trascrizione, Microsoft ha aggiornato anche il fronte della sintesi vocale con due modelli complementari pensati per chiudere il ciclo completo di un agente vocale: MAI-Voice-2.1, che copre 23 lingue in 26 varianti locali a 22 dollari per milione di caratteri generati, e MAI-Voice-2.1-Flash, pensato per la bassa latenza (circa 150 millisecondi end-to-end) e la generazione rapida di clip fino a 45 secondi, a 15 dollari per milione di caratteri. Insieme ai modelli di trascrizione, permettono di costruire un ciclo vocale completo, dall'ascolto alla risposta parlata, interamente con tecnologia Microsoft.
A chi serve davvero questa tecnologia
Il caso d'uso principale che Microsoft indica è quello degli agenti vocali aziendali: assistenti telefonici automatizzati per call center, trascrizione dal vivo delle riunioni su Teams, sottotitolazione in tempo reale per l'accessibilità e strumenti di supporto clinico, un'area in cui Microsoft è già presente tramite l'acquisizione di Nuance. Per chi sviluppa prodotti che si basano su interazioni vocali, il vantaggio di una latenza sotto i 150 millisecondi non è un dettaglio tecnico: è la soglia sotto la quale una conversazione con un assistente automatico comincia a sembrare naturale invece che macchinosa, un fattore che incide direttamente sulla qualità percepita del servizio e, di conseguenza, sulla sua adozione da parte degli utenti finali.
Il commento di PINET
Per le aziende italiane che stanno valutando assistenti vocali per il servizio clienti o per la trascrizione automatica di riunioni, l'arrivo di un modello Microsoft integrato in Azure e in Microsoft 365 Copilot abbassa una barriera tecnica non banale, visto che l'infrastruttura cloud e i contratti enterprise con Microsoft sono già diffusi in molte realtà italiane, dalla pubblica amministrazione alle grandi aziende private. Resta da capire se il supporto all'italiano, una delle 60 lingue annunciate, raggiunga la stessa accuratezza misurata sulle lingue più diffuse nei benchmark citati, dato che i test pubblicati si concentrano su inglese e poche altre lingue principali; su questo aspetto, come spesso accade con gli annunci dei grandi laboratori, servirà una verifica indipendente nell'uso concreto. Va inoltre considerato che si tratta di un prezzo introduttivo e di un modello proprietario senza alternativa open source equivalente per prestazioni: un'azienda che costruisce oggi un servizio critico su questa tecnologia dovrebbe valutare con attenzione sia l'evoluzione dei costi dopo la fine del 2026 sia le implicazioni, in termini di GDPR e trattamento dei dati vocali dei clienti, dell'elaborazione in tempo reale di conversazioni su infrastrutture cloud extra-UE. Un giudizio equilibrato porta a dire che si tratta di un progresso tecnico reale e misurabile sulla latenza, ma la sua utilità pratica per il mercato italiano si misurerà solo quando saranno disponibili dati di accuratezza specifici sull'italiano e un quadro di prezzo stabile nel tempo.
Fonte: THE DECODER e MarkTechPost