Google ha ampliato la sua gamma di modelli Gemini 3.5 introducendo Gemini Audio, che comprende tre nuove soluzioni dedicate all’audio e alla voce: Gemini 3.5 Transcribe, Gemini 3.5 Live e Gemini 3.5 Live Experimental. Questi modelli sono progettati per trascrizioni precise, dialoghi vocali in tempo reale e altre attività complesse. L’annuncio giunge a pochi mesi dal debutto iniziale di Gemini 3.5, affiancandosi alle già presentate versioni 3.6 e 3.7.
Dettagli su Gemini 3.5 Transcribe
Tra le novità spicca Gemini 3.5 Transcribe, il modello più avanzato di Google per la conversione speech-to-text. Rispetto al suo predecessore, Chirp 3, offre una maggior precisione e capacità di rilevare lingue e accenti in oltre 85 lingue. Dotato di trascrizione intelligente, elimina parole riempitive e formatta automaticamente il testo. Inoltre, supporta la funzione di function calling, delegando compiti complessi come la generazione di immagini a altri modelli Gemini. Prestazioni migliorate con un tasso di errore del 4% per audio in streaming e 2,6% per file preregistrati sono possibili anche in ambienti rumorosi. Infine, il modello gestisce vocaboli personalizzati e riconosce fino a tre interlocutori distinti nei dialoghi preregistrati.
Innovazioni nei modelli live
Google ha anche introdotto Gemini 3.5 Live, progettato per rendere le conversazioni vocali in tempo reale più fluide, gestendo interruzioni e elementi visivi senza compromettere il dialogo. Gemini 3.5 Live Experimental rappresenta una variante più avanzata, capace di effettuare ragionamenti mentre parla, descrivendo i progressi durante task complessi.
Distribuzione e disponibilità
La distribuzione di Gemini Audio inizierà prossimamente per tutti gli utenti tramite vari canali come Search Live e Google Docs. Per gli sviluppatori, i modelli saranno accessibili tramite la Gemini API, disponibile su Google AI Studio e Google Antigravity, con implementazioni previste nelle piattaforme aziendali come Gemini Enterprise Agent Platform.









