Mostra sommario Nascondi sommario
- Funzionalità chiave e miglioramenti tecnici per lo speech-to-text
- Due modalità d’uso: file registrati e streaming in tempo reale
- Accuratezza e benchmark: come si posiziona sul mercato
- Integrazione, API e scenari pratici
- Prezzi e concorrenza: confronto con OpenAI
- Limiti, opportunità e cosa possono aspettarsi gli utenti
Google ha presentato una nuova versione del suo sistema di riconoscimento vocale. Si chiama Gemini 3.5 Transcribe e si basa direttamente sull’architettura Gemini. Non è un aggiornamento di Chirp: è un prodotto con un’identità diversa e funzioni pensate per flussi di lavoro moderni.
Funzionalità chiave e miglioramenti tecnici per lo speech-to-text
Google Gemini 3.5 Transcribe: elimina ehm e pause, trascrizioni perfette
LEGO One Piece: 3 set su Amazon più economici di quanto pensi
Il modello porta diverse novità pratiche. La più evidente è la modalità Smart Transcription. Questa funzione rimuove automaticamente interruzioni, ripetizioni e parole riempitive. Il risultato è un testo già formattato e più leggibile rispetto a una trascrizione parola per parola.
- Supporto linguistico: oltre 85 lingue riconosciute.
- Riconoscimento speaker: identifica fino a tre speaker distinti con timestamp.
- Timestamp parola-per-parola: precisione temporale anche a livello di singola parola.
- Vocabolario personalizzato: fino a 1.000 termini personalizzabili. Utile per ambiti medici e tecnici.
- Bassa latenza: streaming con ritardo sub-secondo tramite gemini-3.5-transcribe-live.
Il modello live è accessibile via WebSocket con la Gemini Live API. Google dichiara un netto calo dei tempi complessivi rispetto a Chirp 3. Secondo i dati pubblicati, la velocità di trascrizione è migliorata di circa il 70%.
Due modalità d’uso: file registrati e streaming in tempo reale
Google propone due varianti per scenari diversi. Questo permette di scegliere l’ottimizzazione migliore per ogni flusso di lavoro.
Trascrizione di file (batch)
La versione gemini-3.5-transcribe è pensata per audio pre-registrati. È ideale per riunioni, podcast e registrazioni di call center.

Streaming e sottotitoli live
La versione gemini-3.5-transcribe-live risponde a esigenze di bassa latenza. Serve per sottotitoli in diretta, strumenti di dettatura e agenti vocali.
- Entrambe le varianti disponibili su Google AI Studio.
- Accesso anche tramite piattaforma Gemini Enterprise.
- Implementazioni già in produzione su app come Rambler (Android) e sul client macOS di Gemini.
Accuratezza e benchmark: come si posiziona sul mercato
Sui test multilingue FLEURS, il nuovo modello mostra numeri interessanti. In streaming il Word Error Rate è di 5,50%. In modalità non-streaming scende a 5,04%.
Questi risultati avvicinano Google ai leader della categoria. Tuttavia, alcuni competitor mantengono ancora un vantaggio sulla pura accuratezza. Ad esempio, ElevenLabs Scribe v2 e Microsoft MAI-Transcribe-1.5 registrano errori inferiori su alcune metriche di accuratezza grezza.
Il valore di Gemini 3.5 Transcribe risiede soprattutto nell’integrazione con l’ecosistema Gemini. Il modello può delegare compiti complessi ad altri modelli con function calling. Questo apre possibilità pratiche come generare immagini correlate o analizzare file allegati durante la trascrizione.
Integrazione, API e scenari pratici
La proposta di Google non è soltanto un motore di trascrizione. È una piattaforma che si integra con altri servizi e strumenti.
- Interazioni via Interactions API per file batch.
- WebSocket tramite Gemini Live API per lo streaming.
- Strumenti di developer già predisposti su Google AI Studio.
- Distribuzione su Gemini Enterprise per clienti aziendali.
Tra gli scenari più concreti troviamo:
- Trascrizione automatica di meeting con testo pronto per la lettura.
- Sottotitoli live per eventi e streaming.
- Supporto per contact center con identificazione dei parlanti.
- Applicazioni mediche e tecniche che richiedono vocabolari custom.
Prezzi e concorrenza: confronto con OpenAI
Il panorama competitivo è in rapida evoluzione. Circa un mese prima, OpenAI ha presentato il suo modello GPT-Transcribe. Le community di sviluppatori hanno già avviato confronti pratici.

Sul fronte economico, la versione live di Gemini 3.5 Transcribe costa intorno a 0,009 dollari al minuto. È approssimativamente la metà del prezzo del servizio realtime di OpenAI. Questo può essere decisivo per chi costruisce pipeline di trascrizione su larga scala.
- Vantaggi economici: costi ridotti per trascrizioni continue.
- Vantaggi tecnologici: integrazione nativa con Gemini e Smart Transcription.
- Sfida principale: convincere team abituati a soluzioni specializzate a migrare.
Limiti, opportunità e cosa possono aspettarsi gli utenti
La sfida non è solo tra numeri di accuratezza. È anche culturale. Alcuni clienti preferiscono trascrizioni verbatim per motivi legali o qualitativi. Altri desiderano testo già pulito e fruibile.
- Pro: testo leggibile senza post-editing, integrazione con tool di analisi, costi competitivi.
- Contro: su alcuni benchmark la precisione grezza non è ancora la migliore.
- Opportunità: se Smart Transcription diventerà lo standard, il concetto di “buona trascrizione” potrebbe cambiare.











