更新日期:2026 年 9 月 11 日。Gemini TTS 在 2026 年已經形成一條很清楚的產品線:Gemini 3.1 Flash TTS 主打更自然、可控、低延遲與 Audio Tags;Gemini 2.5 Flash TTS 則以更低價格與 Free Tier 吸引大量 API 使用;2.5 Pro TTS 則偏向更高品質的自然語音。對開發者而言,Gemini TTS 的差異化不只價格,而是 30 個 voices、multi-speaker、70+ 語言、自然語言導演與 Batch API。
先看結論:如果你要低成本測試、Free Tier、Podcast 對話、multi-speaker、Audio Tags 或大量 API 生成,Gemini TTS 很值得優先試;如果你主要需要最簡單的 OpenAI Speech API 整合,可一起比較 GPT-4o Mini TTS;若核心是 Voice Clone、Dubbing 與品牌 Voice,ElevenLabs 會更完整。
Gemini TTS 是什麼?
Gemini API 的 TTS 可以把文字直接生成單人或多人語音,並用自然語言控制 style、accent、pace、tone。它和 Gemini Live API 不同:Live API 更適合互動式、即時、非結構化語音對話;Gemini TTS 則更適合需要「照指定文字念出來」的 Podcast、Audiobook、影片旁白與內容生成。
目前官方支援的 TTS 模型包括 Gemini 3.1 Flash TTS Preview、Gemini 2.5 Flash Preview TTS 與 Gemini 2.5 Pro Preview TTS。
Gemini TTS 2026 價格
| 模型 | 文字輸入 | 音訊輸出 | Free Tier | Batch |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS Preview | US$1/1M tokens | US$20/1M audio tokens | 有 | US$0.50/US$10 |
| Gemini 2.5 Flash Preview TTS | US$0.50/1M tokens | US$10/1M audio tokens | 有 | US$0.25/US$5 |
| Gemini 2.5 Pro Preview TTS | US$1/1M tokens | US$20/1M audio tokens | 無 | US$0.50/US$10 |
Google 官方說明,TTS 音訊大約以 25 audio tokens/秒換算。因此如果只比較純音訊生成成本,2.5 Flash Preview TTS 目前是三個模型中最便宜的付費選項。
3.1 Flash TTS 有什麼不同?
Gemini 3.1 Flash TTS 在 2026 年 4 月推出,官方定位是更自然、更有表現力、控制更細緻的新一代 TTS。它支援 70+ 語言、native multi-speaker dialogue,並加入 Audio Tags 與更完整的導演控制。
如果你需要角色演出、Podcast、故事、廣告旁白或需要同一 voice 在不同段落快速切換情緒,3.1 Flash TTS 的價值會比單純追求最低價格更高。
Audio Tags:直接在文字裡控制聲音
Audio Tags 是 Gemini TTS 很有特色的控制方式。你可以直接在 transcript 中加入像:
[whispers][shouting][laughs][serious][excitedly][very slow]
讓模型在特定段落改變語氣、速度或情緒。Google 也提醒,如果 transcript 不是英文,Audio Tags 仍建議用英文寫,通常會有比較好的結果。
30 個內建 Voices
Gemini TTS 目前官方文件列出 30 個 voice options,例如 Zephyr、Puck、Charon、Kore、Fenrir、Leda、Orus、Aoede、Callirrhoe、Autonoe、Enceladus、Iapetus、Umbriel、Algieba、Despina、Erinome、Algenib、Rasalgethi、Laomedeia、Achernar、Alnilam、Schedar、Gacrux、Pulcherrima、Achird、Zubenelgenubi、Vindemiatrix、Sadachbia、Sadaltager、Sulafat。
每個 voice 都有不同的描述,例如 Bright、Upbeat、Informative、Firm、Soft、Warm、Friendly 等。正式上線前,應用真實腳本在 AI Studio 直接比較,而不是只看文字標籤。
Multi-speaker:Podcast 與對話的優勢
Gemini TTS 支援 single-speaker 與 multi-speaker。這對 Podcast、訪談模擬、角色對話、教學對談特別實用,因為可以在同一次生成裡指定不同角色的 voices,而不是生成多個檔案再手動拼接。
如果你的內容本來就是兩人對談,Gemini TTS 會比只支援單 speaker 的簡單 TTS workflow 更省後製時間。
70+ 語言與中文
Gemini 3.1 Flash TTS 官方目前標示支援 70+ 語言。Gemini TTS 文件也列有 Mandarin Chinese(cmn)等語言,並會自動偵測輸入語言。
但「支援中文」仍不等於「台灣國語一定自然」。正式採用前建議測:
- 台灣繁體中文句型。
- 台灣品牌、人名、地名。
- 中英混合產品名稱。
- 數字、價格、百分比與日期。
- 長句、問句、情緒與多人對談。
如果你的核心受眾是台灣,應用完全相同的腳本比較 Gemini、OpenAI 與 ElevenLabs。
Gemini 3.1 Flash TTS vs 2.5 Flash TTS
| 比較 | 3.1 Flash TTS | 2.5 Flash TTS |
|---|---|---|
| 文字輸入 | US$1/1M | US$0.50/1M |
| 音訊輸出 | US$20/1M | US$10/1M |
| Free Tier | 有 | 有 |
| Batch | US$0.50/US$10 | US$0.25/US$5 |
| 重點 | 品質、表現力、Audio Tags、控制 | 低成本、低延遲、大量生成 |
如果只想大量生成一般旁白,2.5 Flash 的成本非常有吸引力;如果需要更細緻的情緒與演出控制,3.1 Flash 更值得。
Gemini TTS vs OpenAI GPT-4o Mini TTS
| 比較 | Gemini TTS | OpenAI GPT-4o Mini TTS |
|---|---|---|
| Free Tier | 3.1/2.5 Flash 有 | 目前不支援 |
| Voices | 30 | 13 |
| Multi-speaker | 支援 | 主要 Speech API 工作流偏單一 voice |
| 控制方式 | Prompt+Audio Tags | Instructions+speed |
| 最低付費成本 | 2.5 Flash US$0.50/US$10 | US$0.60/US$12 |
| 適合 | Podcast、多角色、Free Tier、大量測試 | OpenAI API 生態、產品內 TTS |
OpenAI 的完整指南可看 GPT-4o Mini TTS 2026 教學。
Gemini TTS vs ElevenLabs
Gemini TTS 的強項是 API、Free Tier、multi-speaker、Prompt/Audio Tags 與 Google AI Studio;ElevenLabs 則在 Voice Clone、Dubbing、Studio、Voice Library 與完整創作者工作流更成熟。兩邊不是完全同一種產品,應依工作流選擇。
需要完整 Voice 平台比較可看 ElevenLabs 2026 評測與教學。
Free Tier 要注意什麼?
Gemini 3.1 Flash TTS 與 2.5 Flash Preview TTS 目前都有 Free Tier;但 Google 官方 Pricing 同時標示,Free Tier 輸入可能被用來改善 Google 產品,Paid Tier 則標示不會。正式處理敏感、客戶或商業資料前,應依公司資料政策選擇合適層級。
SynthID:AI 音訊有浮水印
Google 官方說明,Gemini 3.1 Flash TTS 產生的音訊會加入不可感知的 SynthID 浮水印,以協助識別 AI 生成內容。這對企業、教育與公開發布內容是一個重要的治理差異。
常見問題
Gemini TTS 免費嗎?
Gemini 3.1 Flash TTS 與 2.5 Flash Preview TTS 目前都有 Free Tier;2.5 Pro TTS 則沒有 Free Tier。
哪個最便宜?
目前付費價最低的是 Gemini 2.5 Flash Preview TTS:文字 US$0.50/1M tokens、音訊 US$10/1M audio tokens;Batch 再減半。
可以做兩人 Podcast 嗎?
可以。Gemini TTS 支援 multi-speaker,可為不同角色指定不同 voices。
支援中文嗎?
支援 Mandarin Chinese 與多種語言,但台灣國語自然度仍應用你的真實內容測試。
Audio Tags 是什麼?
是在 transcript 內加入的自然語言標記,例如 [whispers]、[laughs],用來控制特定句子的語氣、節奏與表現。
結論:Gemini TTS 的優勢是 Free Tier、多人語音與細緻控制
Gemini TTS 很適合需要低成本大量生成、Podcast 對話、多角色、Audio Tags 與 Google AI Studio 工作流的人。2.5 Flash TTS 更偏成本效率,3.1 Flash TTS 則偏品質與表達控制。若你已經在 OpenAI API 生態,可一起比較 GPT-4o Mini TTS;若需要 Voice Clone/Dubbing/Studio,ElevenLabs 仍然是另一種更完整的選擇。
完整市場比較請看 AI 語音工具推薦 2026。

