您可以生成以下类型的音频:
使用 Gemini 文字转语音 (TTS) 模型根据文本输入生成语音。
使用 Gemini Live API生成双向流式传输音频输出。
TTS 与 Live API 之间的比较
文字转语音 (TTS) 模型和 Live API 模型都是低延迟的语音生成模型,可以配置为使用不同的回答声音和语言。不过,它们的应用场景截然不同。
文字转语音 (TTS) 生成是一种单向的请求-响应交互(输入文字,输出音频)。它专为需要准确朗读所提供文本并对风格和声音进行精细控制的场景而量身打造,例如播客旁白、有声读物或朗读文章。
Live API 生成支持双向流式传输,可进行实时语音对话(语音输入、语音输出)。它擅长处理动态对话上下文,在这种情况下,模型会决定要返回的适用语音。请注意,最新的 Live API 模型还支持视频和图片输入。