更新日期:2026 年 8 月 27 日
Google 於 2026 年 8 月 26 日正式推出 Gemini 3.5 Transcribe,定位為目前 Gemini 系列中最精準的語音轉文字(Speech-to-Text)模型。它不只把聲音轉成逐字稿,還能自動處理口語自我修正、移除贅詞並整理格式,並支援超過 85 種語言。
這次發布對開發者、會議紀錄、Podcast、客服通話與語音 Agent 都有直接影響。Google 也已把模型開放到 Gemini API,並擴展到 Android、Gemini macOS、Google Antigravity 等產品。
Gemini 3.5 Transcribe 是什麼?
Gemini 3.5 Transcribe 是 Google 新一代智慧語音辨識模型。與傳統 STT 工具只追求逐字辨識不同,它會理解使用者實際想表達的內容。例如說話者先說「星期二」,隨後改口「不,星期三」,模型可直接整理成修正後的結果;口語中的「嗯」、「啊」等 filler words 也能自動清理。
Gemini 3.5 Transcribe 有哪些新功能?
- 85+ 語言:可自動偵測並轉錄超過 85 種語言,並處理不同地區口音。
- 即時串流:透過 Live API 提供低於一秒延遲的連續雙向串流,適合語音 Agent、即時字幕等情境。
- 預錄音訊:可透過 Interactions API 處理會議、通話紀錄與其他錄音。
- 多人辨識:預錄音訊可辨識最多 3 名說話者並提供 word-level timestamps;3 人以上目前屬實驗性支援。
- 自訂詞彙:可辨識專業術語、特殊拼法與使用者提供的 vocabulary。
- 智慧整理:可處理自我修正、去除贅詞並自動格式化文字。
- Function Calling:在 Gemini macOS app 等情境中,可把圖片生成、檔案分析等任務交給其他 Gemini 模型。
Gemini 3.5 Transcribe API 怎麼使用?
Google 將模型分成兩種主要開發方式:即時語音使用 Live API;已錄好的音訊則使用 Interactions API。開發者目前可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 建立相關應用。
因此,如果你正在做即時客服、AI 語音助理或字幕工具,可優先看串流 API;如果需求是 Podcast、會議記錄、客服錄音分析,預錄音訊模式會更合適。
辨識準確度如何?
Google 引述 Artificial Analysis 的測試表示,Gemini 3.5 Transcribe 平均 Word Error Rate(WER)在串流情境約為 4.0%,非串流情境約為 2.6%。這是官方發布內容引用的第三方測試結果,實際準確率仍會受到語言、口音、收音品質、背景噪音與專有名詞影響。
一般使用者在哪裡會用到?
Google 表示,這套模型已用於 Android 的 Rambler 與 Gemini macOS app,未來也將擴展到 Chrome、Search Live、Gemini Live、Docs、Keep 與 Gmail 等產品。部分功能仍屬逐步推出,因此不同地區與帳號的實際可用時間可能不同。
為什麼這次更新值得注意?
Gemini 3.5 Transcribe 的重點不是單純「更準的聽寫」,而是把語音輸入變成可以直接使用的結構化文字,並進一步連接 AI Agent 與其他 Gemini 模型。對中文使用者而言,85+ 語言與跨口音支援尤其值得關注;若後續全面進入 Chrome、Gmail 與 Docs,語音輸入可能從手機功能變成 Google 生產力工具的共同入口。
延伸閱讀
官方來源與查核
本文主要依據 Google 於 2026 年 8 月 26 日發布的 Gemini 3.5 Transcribe 官方公告,並以同日科技媒體對產品功能與推出範圍的報導交叉確認。Google 官方公告指出模型已提供給開發者,並列出 85+ 語言、串流/預錄 API、多人辨識、自訂詞彙與 Function Calling 等能力。
本文將依 Google 後續公布的 API 定價、地區支援與產品 rollout 持續更新。