Puoi generare i seguenti tipi di audio:
Genera parlato dall'input di testo utilizzando modelli di sintesi vocale (TTS) Gemini.
Genera output audio con streaming bidirezionale utilizzando Gemini Live API.
Confronto tra TTS e Live API
Sia i modelli di sintesi vocale (TTS) sia i modelli Live API sono modelli a bassa latenza, che generano parlato e possono essere configurati per diverse voci di risposta e lingue. Tuttavia, servono casi d'uso molto diversi.
La generazione di sintesi vocale (TTS) è un'interazione unidirezionale di richiesta-risposta (testo in, audio out). È pensata per scenari che richiedono la recitazione esatta del testo fornito con un controllo granulare su stile e suono, come la narrazione di podcast, audiolibri o la lettura di articoli ad alta voce.
Live API generazione supporta bidirezionale streaming per conversazioni vocali in tempo reale (voce in, voce out). È ideale in contesti conversazionali dinamici in cui il modello decide il parlato applicabile da restituire. Tieni presente che i modelli più recenti Live API supportano anche l'input di video e immagini.