สร้างเสียงโดยใช้ Gemini API

คุณสร้างเสียงประเภทต่อไปนี้ได้

การเปรียบเทียบระหว่าง TTS กับ Live API

ทั้งโมเดลการอ่านออกเสียงข้อความ (TTS) และโมเดล Live API เป็นโมเดลที่มีเวลาในการตอบสนองต่ำ ซึ่งสร้างคำพูดและกำหนดค่าให้ใช้เสียงและภาษาที่แตกต่างกันในการตอบได้ อย่างไรก็ตาม ทั้ง 2 อย่างนี้มีกรณีการใช้งานที่แตกต่างกันมาก

  • การสร้างการอ่านออกเสียงข้อความ (TTS) เป็นการโต้ตอบแบบคำขอ-คำตอบทางเดียว (ข้อความเข้า เสียงออก) โดยได้รับการปรับแต่งสำหรับสถานการณ์ที่ต้องอ่านออกเสียงข้อความที่ระบุอย่างถูกต้อง พร้อมการควบคุมสไตล์และเสียงอย่างละเอียด เช่น การบรรยายพอดแคสต์ หนังสือเสียง หรือการอ่านบทความออกเสียง

  • Live API รุ่นรองรับการสตรีมแบบสองทิศทางสำหรับการสนทนาด้วยเสียงแบบเรียลไทม์ (เสียงเข้า เสียงออก) โดยมีความสามารถในการสนทนาแบบไดนามิก ซึ่งโมเดลจะตัดสินใจเลือกคำพูดที่เหมาะสมเพื่อตอบกลับ โปรดทราบว่าLive API โมเดลล่าสุดยังรองรับอินพุตวิดีโอและรูปภาพด้วย