คุณสร้างเสียงประเภทต่อไปนี้ได้
สร้างคำพูดจากข้อความที่ป้อน โดยใช้โมเดลGeminiการอ่านออกเสียงข้อความ (TTS)
สร้างเอาต์พุตเสียงที่สตรีมแบบสองทิศทาง โดยใช้ Gemini Live API
การเปรียบเทียบระหว่าง TTS กับ Live API
ทั้งโมเดลการอ่านออกเสียงข้อความ (TTS) และโมเดล Live API เป็นโมเดลที่มีเวลาในการตอบสนองต่ำ ซึ่งสร้างคำพูดและกำหนดค่าให้ใช้เสียงและภาษาที่แตกต่างกันในการตอบได้ อย่างไรก็ตาม ทั้ง 2 อย่างนี้มีกรณีการใช้งานที่แตกต่างกันมาก
การสร้างการอ่านออกเสียงข้อความ (TTS) เป็นการโต้ตอบแบบคำขอ-คำตอบทางเดียว (ข้อความเข้า เสียงออก) โดยได้รับการปรับแต่งสำหรับสถานการณ์ที่ต้องอ่านออกเสียงข้อความที่ระบุอย่างถูกต้อง พร้อมการควบคุมสไตล์และเสียงอย่างละเอียด เช่น การบรรยายพอดแคสต์ หนังสือเสียง หรือการอ่านบทความออกเสียง
Live API รุ่นรองรับการสตรีมแบบสองทิศทางสำหรับการสนทนาด้วยเสียงแบบเรียลไทม์ (เสียงเข้า เสียงออก) โดยมีความสามารถในการสนทนาแบบไดนามิก ซึ่งโมเดลจะตัดสินใจเลือกคำพูดที่เหมาะสมเพื่อตอบกลับ โปรดทราบว่าLive API โมเดลล่าสุดยังรองรับอินพุตวิดีโอและรูปภาพด้วย