Google เปิดตัว Gemini 3.8 Flash TTS และ Flash-Lite TTS เมื่อ AI ไม่ได้แค่พูด แต่สร้าง “เสียง” ได้ตามสั่ง

ยุคของ AI อ่านข้อความด้วยน้ำเสียงสำเร็จรูปอาจกำลังจะกลายเป็นเรื่องเก่า เพราะล่าสุด Google เปิดตัว Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS โมเดลสร้างเสียงพูดรุ่นใหม่ที่ไม่ได้หยุดอยู่แค่การเปลี่ยน Text เป็น Speech แต่เปิดให้ผู้ใช้สามารถ ออกแบบบุคลิกของเสียง สำเนียง จังหวะ อารมณ์ และวิธีการพูดได้ด้วยภาษาธรรมชาติ

พูดง่าย ๆ คือ แทนที่จะเลือกเพียงว่าอยากใช้ “เสียงผู้ชาย” หรือ “เสียงผู้หญิง” เราอาจบอก AI ได้เลยว่า

“ต้องการเสียงนักเล่าเรื่องวัยกลางคน โทนนุ่ม สุขุม มีสำเนียงอังกฤษเล็กน้อย พูดช้าในช่วงดราม่า และเพิ่มความตื่นเต้นเมื่อเข้าสู่ฉากสำคัญ”

จากนั้น Gemini ก็สามารถสร้างเสียงที่มีคาแรกเตอร์ตามคำอธิบายนั้นขึ้นมาได้

Google เปิดตัวโมเดลทั้งสองอย่างเป็นทางการเมื่อวันที่ 23 กันยายน 2026 พร้อมวางตำแหน่งให้ Gemini 3.8 Flash TTS เป็นโมเดลระดับเรือธงสำหรับงานสร้างสรรค์เสียง ส่วน Flash-Lite TTS เน้นความเร็ว ต้นทุน และการประมวลผลในปริมาณมาก

จาก Text-to-Speech สู่ “AI Voice Studio”

สิ่งที่น่าสนใจที่สุดของ Gemini 3.8 Flash TTS คือแนวคิด Generative Voice Design

เดิมทีบริการ Text-to-Speech ส่วนใหญ่จะมีคลังเสียงที่สร้างเตรียมไว้ ผู้ใช้อาจเลือกเสียง A, B หรือ C แล้วปรับความเร็วหรือระดับเสียงเพิ่มเติมเล็กน้อย

แต่ Gemini 3.8 Flash TTS ขยับไปอีกขั้น โดย Google ระบุว่าสามารถสร้างเสียงใหม่จากคำอธิบายด้วยภาษาธรรมชาติ ไม่ว่าจะเป็นบทบาทของตัวละคร สำเนียง บุคลิก หรือคุณลักษณะของเสียง ทำให้ผู้สร้างคอนเทนต์สามารถออกแบบ “Voice Persona” ของตัวเองได้มากกว่าการเลือกเสียงจากรายการที่กำหนดไว้

สิ่งนี้เปิดความเป็นไปได้ให้กับทั้งเกม หนังสือเสียง Podcast แอนิเมชัน โฆษณา ไปจนถึง Voice Agent ของบริษัท

ตัวละครมังกรในเกมอาจมีเสียงใหญ่ หยาบ และพูดเหมือนกำลังคำราม ขณะที่ AI Customer Service ของธนาคารอาจถูกกำหนดให้พูดด้วยโทนสุภาพ นิ่ง และให้ความรู้สึกน่าเชื่อถือ

เสียงจึงไม่ได้เป็นเพียง “Output” ของ AI อีกต่อไป แต่กลายเป็นองค์ประกอบหนึ่งของการออกแบบประสบการณ์ผู้ใช้

สั่งการแสดงได้แทบเหมือนกำกับนักพากย์

อีกความสามารถสำคัญคือการควบคุมการพูดแบบละเอียด

Gemini TTS รุ่นใหม่สามารถรับคำสั่งเกี่ยวกับ Style, Accent, Pace และ Tone รวมถึงการกำหนดลักษณะการพูดในแต่ละช่วงของบทได้ จึงเหมาะกับงานที่ต้องการการถ่ายทอดอารมณ์มากกว่าการอ่านประโยคออกมาตรง ๆ

เช่น ประโยคหนึ่งอาจถูกกำหนดให้พูดอย่างสงบ แต่ประโยคถัดไปให้ลดเสียงลงเหมือนกำลังกระซิบ หรือเพิ่มความตื่นเต้นเมื่อเข้าสู่ฉากสำคัญ

ระบบยังรองรับเสียงประกอบการสนทนาที่เป็นธรรมชาติมากขึ้น เช่น การหัวเราะ ถอนหายใจ หายใจเฮือก หรือเสียงตอบรับอย่าง “อืม” และ “ใช่” ซึ่งช่วยให้บทสนทนาของ AI ฟังดูใกล้เคียงการแสดงของมนุษย์มากกว่าเสียงอ่านข้อความแบบเดิม

หนึ่งสคริปต์ สร้างบทสนทนาสองคนได้

สำหรับงาน Podcast หนังสือเสียง หรือบทละคร Gemini 3.8 Flash TTS ยังรองรับการสร้างฉากสนทนาที่มีผู้พูดสองคนจากสคริปต์เดียว

โมเดลสามารถรักษาเสียงของตัวละครแต่ละคนให้แตกต่างกัน พร้อมจัดจังหวะการผลัดกันพูดให้เป็นธรรมชาติ

นี่เป็นรายละเอียดที่สำคัญมากสำหรับงาน Long-form เพราะปัญหาหนึ่งของระบบสร้างเสียง AI คือ เมื่อสร้างเสียงต่อเนื่องเป็นเวลานาน บุคลิกหรือโทนเสียงของตัวละครอาจค่อย ๆ เปลี่ยนไป

Google ระบุว่า Gemini 3.8 Flash TTS ได้รับการออกแบบให้รักษาคุณภาพเสียง จังหวะ และลักษณะเสียงของตัวละครได้ดีขึ้นในการสร้างเสียงต่อเนื่องยาวหลายชั่วโมง จึงเหมาะกับงานอย่าง Audiobook และ Podcast โดยตรง

Gemini 3.8 Flash TTS กับ Flash-Lite TTS ต่างกันอย่างไร?

Google แบ่งโมเดลออกเป็นสองระดับตามลักษณะการใช้งาน

Gemini 3.8 Flash TTS เน้นคุณภาพของเสียง ความละเอียดในการแสดงอารมณ์ การออกเสียงที่ซับซ้อน และการรองรับสำเนียงหรือภาษาถิ่น เหมาะกับงานอย่างหนังสือเสียง งานพากย์ระดับสตูดิโอ บทสนทนาหลายตัวละคร และงานที่ต้องควบคุมการแสดงของเสียงอย่างละเอียด โดยรองรับประมาณ 130 ภาษา

ส่วน Gemini 3.8 Flash-Lite TTS ถูกออกแบบให้มี Latency ต่ำ ประมวลผลได้ในปริมาณมาก และควบคุมต้นทุนได้ดีกว่า เหมาะกับระบบอ่านออกเสียง Voice Agent แบบเรียลไทม์ การสร้างเสียงจำนวนมาก หรือระบบที่ต้องให้ AI พูดตอบผู้ใช้ตลอดเวลา โดยรองรับ 101 ภาษา

จุดที่น่าสนใจสำหรับนักพัฒนาคือทั้งสองรุ่นใช้โครงสร้าง API และรูปแบบ Prompt เดียวกัน ทำให้สามารถเปลี่ยนจาก Flash-Lite ไปเป็น Flash หรือกลับกันได้โดยไม่จำเป็นต้องออกแบบระบบใหม่ทั้งหมด

ไม่ได้มีแค่สร้างเสียงใหม่ แต่ยัง “จำลองเสียง” ได้

Gemini 3.8 TTS ยังรองรับระบบ Voice Replication รวมถึงคลังเสียงสำเร็จรูปและ Custom Voice Persona

ใน Google AI Studio ผู้ใช้สามารถทดลองออกแบบและจำลองเสียงผ่านอินเทอร์เฟซได้โดยตรง ก่อนนำ Voice ที่สร้างขึ้นไปใช้กับแอปพลิเคชันผ่าน Gemini API

ความสามารถลักษณะนี้อาจมีประโยชน์อย่างมากสำหรับธุรกิจที่ต้องการสร้าง “เสียงประจำแบรนด์”

ลองนึกภาพแอปหนึ่งที่มีเสียง AI เดียวกันตั้งแต่โฆษณา Tutorial ในแอป ระบบช่วยเหลือลูกค้า ไปจนถึง Podcast ของบริษัท ทุกช่องทางสามารถรักษา Voice Identity เดียวกันได้

Google ยังระบุว่ามีระบบด้านความปลอดภัย เช่นการใส่ Watermark ในเสียงที่ AI สร้างขึ้น เพื่อช่วยรองรับการใช้งานเทคโนโลยีสร้างเสียงอย่างรับผิดชอบ

การแข่งขันของ Generative AI กำลังขยับจาก “คำตอบ” ไปสู่ “การแสดง”

ช่วงแรกของการแข่งขัน Generative AI เรามักเปรียบเทียบกันว่าโมเดลไหนตอบคำถามเก่งกว่า เขียนโค้ดดีกว่า หรือสร้างภาพสวยกว่า

แต่การมาของ Gemini 3.8 TTS สะท้อนอีกทิศทางที่น่าสนใจ นั่นคือการแข่งขันกำลังขยับเข้าสู่เรื่องของ Performance

สำหรับเสียง AI ความถูกต้องของประโยคอาจไม่เพียงพออีกต่อไป

ประโยคเดียวกันเมื่อพูดด้วยความลังเล ความโกรธ ความอบอุ่น หรือความประชด สามารถสื่อความหมายแตกต่างกันอย่างสิ้นเชิง

ความสามารถในการกำหนดบุคลิก เสียง สำเนียง จังหวะ และอารมณ์ จึงทำให้ Text-to-Speech เริ่มเปลี่ยนจาก “ระบบอ่านข้อความ” ไปสู่เครื่องมือสำหรับกำกับการแสดงด้วยเสียง

นักพัฒนาและครีเอเตอร์เริ่มใช้งานได้แล้ว

Gemini 3.8 Flash TTS และ Flash-Lite TTS เริ่มเปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio โดย Flash TTS ยังถูกนำไปใช้ใน Gemini Notebook ขณะที่ Flash-Lite TTS ถูกนำไปใช้กับ Google Vids และ Google มีแผนนำเทคโนโลยีดังกล่าวเข้าสู่ Gemini Enterprise ด้วย

Google ยังระบุถึงการทำงานร่วมกับแพลตฟอร์มและบริษัทต่าง ๆ เช่น Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen และ Wondercraft เพื่อรองรับการนำระบบเสียงไปใช้ตั้งแต่ Voice Agent ไปจนถึงการพากย์และ Localization คอนเทนต์ในหลายภาษา

เมื่อ “เสียง” กลายเป็นสิ่งที่ Prompt ได้

จุดเปลี่ยนที่สำคัญที่สุดของ Gemini 3.8 Flash TTS อาจไม่ใช่แค่เรื่องคุณภาพเสียงที่ดีขึ้น

แต่คือการเปลี่ยนวิธีคิดเกี่ยวกับเสียงดิจิทัลทั้งหมด

ที่ผ่านมาเราต้อง ค้นหาเสียงที่เหมาะสม จากคลังที่มีอยู่ แต่ในอนาคตเราอาจเพียงแค่ อธิบายเสียงที่ต้องการ

อยากได้เสียงแบบไหน สำเนียงอะไร อายุประมาณเท่าไร บุคลิกเป็นอย่างไร พูดเร็วหรือช้า และประโยคไหนควรแสดงอารมณ์แบบใด ทั้งหมดอาจกลายเป็นสิ่งที่ควบคุมผ่าน Prompt ได้

และเมื่อ AI สามารถเขียนบท สร้างภาพ สร้างวิดีโอ และตอนนี้สามารถ “ออกแบบนักพากย์” ให้กับคอนเทนต์ได้ด้วย เส้นแบ่งระหว่างเครื่องมือ Generative AI กับสตูดิโอผลิตสื่อแบบครบวงจรก็กำลังบางลงเรื่อย ๆ

Gemini 3.8 Flash TTS จึงอาจไม่ใช่แค่ Text-to-Speech รุ่นใหม่ของ Google

แต่มันคืออีกก้าวของยุคที่เราไม่ได้เพียงสั่ง AI ว่า “พูดอะไร”

เรากำลังสั่งมันได้ด้วยว่า “พูดอย่างไร”

ใส่ความเห็น

อีเมลของคุณจะไม่แสดงให้คนอื่นเห็น ช่องข้อมูลจำเป็นถูกทำเครื่องหมาย *