Gemini 3.5 Transcribe โมเดล speech-to-text แม่นยำสูง เตรียมขยายไปยังแพลตฟอร์มนักพัฒนาและ Gemini บน Chrome 

Google เปิดตัว Gemini 3.5 Transcribe โมเดล speech-to-text ที่แม่นยำที่สุดของ Google ในตอนนี้ จัดการเสียงรบกวนเบื้องหลัง สุ้มเสียงที่ฟังยาก ให้เสียงพูดไม่เป็นระเบียบเป็นข้อความที่สละสลวย และเป็นรูปแบบที่พร้อมใช้

โมเดล speech-to-text ที่มี Gemini ทำงานเบื้องหลัง เริ่มใช้งานในแอปทั่วไปแล้วอย่าง  Rambler บน Android ใช้งานผ่านแป้นพิมพ์มือถือ (ยังไม่รองรับภาษาไทย), แอป Gemini และ Gemini  บน  macOS ล่าสุดเปิดตัวโมเดลใหม่ Gemini 3.5 Transcribe ขยายไปยัง Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform เปิดทางให้นักพัฒนานำโมเดลไปสร้างเครื่องมือ voice agent และเครื่องมือทำข้อความจากเสียงแบบเรียลไทม์

ความสามารถหลักของ Gemini 3.5 Transcribe คือทำความสะอาดข้อความให้อัตโนมัติ โดยลบคำ “เอ่อ”, “อ่า” จัดรูปแบบข้อความอ่านง่าย และรับรู้การแก้ไขประโยคกลางคันของผู้พูด มีอัตราความผิดพลาดของคำ (WER) ต่ำเพียง 2.6% สำหรับไฟล์บันทึกเสียง และ 4.0% สำหรับการ streaming แบบเรียลไทม์ ตรวจจับและถอดความได้มากกว่า 85 ภาษา รวมถึงแยกแยะสำเนียงและภาษาถิ่น แยกแยะเสียงพูดได้สูงสุด 3 คนในไฟล์บันทึกเสียง พร้อมลง Timestamp ให้

Gemini 3.5 Transcribe เตรียมรองรับการพูดเพื่อพิมพ์ ในช่อง Gemini บน Chrome เร็วๆ นี้