NiceKate AI觀看原文

NiceKate AI:Gemini 3.1 Flash TTS 太能打了,價格、Demo、提示詞一次講清

凱潔深度實測 Gemini 3.1 Flash TTS:價格只要 ElevenLabs 的零頭,支援多說話人對白、70+ 語言、自然語言控制音色與情緒。本文附完整提示詞教學與 Hermes 整合實戰。

開場閒聊

凱潔一開場就笑說:「去年我介紹了 Gemini 2.5 的 TTS,效果非常好。但今天 Gemini 3.1 Flash TTS 出來了,價格更便宜、功能更強。」

她提到目前可以在 Google AI Studio 等多個平台上使用這款新模型,並展示了一張 TTS 排行榜圖表——榜上最好的效果是 ElevenLabs TTS 1.5 Max,第二名就是 Gemini 3.1 Flash TTS,擠下了一票老牌語音引擎。

凱潔語氣中帶著興奮:「免費用戶一天最多可以調用十次,API 價格她估算了一下,生成 10 分鐘音頻大約只需 0.3 美元,如果採用批量生成甚至更便宜。」

懶人包速覽

核心痛點 解決方案 / 關鍵觀點
TTS 價格太貴,小團隊用不起 Gemini 3.1 Flash TTS 生成 10 分鐘音頻只要約 $0.3 美元,批量還能更省
多說話人對白需要複雜後期 原生支援雙角色對話,無需剪輯,用文字標籤即可切換角色
語音效果不夠自然 排行榜僅次於 ElevenLabs,支援 70+ 語言、30 種音色選項
提示詞不好掌握 官方提供完整示範標籤,AI Studio 可免費調試到完美再導出

凱潔這次全面介紹了 Gemini 3.1 Flash TTS 的功能、價格、提示詞寫法以及與 Hermes 的整合方式,看完可以直接上線使用。

Gemini 3.1 Flash TTS 的三大亮點

價格超親民

凱潔算了一筆帳:生成 10 分鐘的音頻,大約只需要 0.3 美元。如果採用批量模式,雖然速度會慢一點,但價格會更便宜。

看完她的完整評測,確實印證了 Gemini 3.1 Flash TTS 太能打了,價格便宜的結論。對比市面上主流的 TTS 服務——ElevenLabs TTS 1.5 Max 排名第一但價格不低——Gemini 3.1 Flash TTS 以不到十分之一的價格提供幾乎同等級的品質。而且免費用戶每天可以免費調用十次,足夠個人開發者或小團隊做原型驗證。

多說話人對白,原生支援

這一代 TTS 最大的亮點,是支援多說話人自然對話

凱潔特別強調:「最多支援兩個角色,完全不需要複雜的後期處理。你只要在文本中用中括號標上角色標籤,Gemini 就會自動切換音色來扮演不同的人。」

她現場展示了六段 Demo 音頻,涵蓋了多種情境:

  • 中文笑話:兩個角色一搭一唱,語氣自然不僵硬
  • 恐怖片定律:模擬對話場景,節奏感好
  • AI 吐槽大會:單人節目的綜藝感
  • 警探審訊:戲劇性的雙人對話
  • 詩意獨白:溫柔抒情的單人朗讀

其中她最推薦的是恐怖片那段——主角說「我出去看看」時,觀眾心想「別出去呀」,這種日常幽默感透過 TTS 傳達得相當到位。

音色控制靠提示詞

凱潔強調,Gemini 3.1 Flash TTS 支援自然語言控制,你不會看到傳統 TTS 那種參數複雜的介面,而是直接寫一段文字描述場景,模型就會自動理解你想要的語氣和氛圍。

官方推薦的提示詞模板包括:

  • 場景描述(越生動越好)
  • 角色設定(保持人設)
  • 語言標籤(用英文中括號)

她特別提醒一個坑:「標籤建議用英文來寫,如果用中文標籤,模型可能會把標籤本身也讀出來。」

提示詞實戰:六段音頻的寫法拆解

第一段:中文笑話(最基礎的雙人對話)

凱潔示範的最簡單用法——直接把笑話文本傳給 TTS,讓它用自然的中文對話表演。不過她坦白說自己一開始標籤用錯了,沒有按照官方的規範走。

第二段:恐怖片定律(標準標籤用法)

這一段就比較規範了。凱潔用標準的中括號標籤來控制角色切換,效果明顯比第一段更好。

第三段:AI 吐槽大會(單人節目風格)

這是最有趣的一段——模擬 AI 主持人吐槽人類的奇怪問題:「有人問我會愛上人類嗎?大哥,我連心跳都沒有,怎麼談戀愛?還有人問我能預測彩票號碼嗎?我要是能預測,我早就在夏威夷曬太陽了。」

第四到六段:警探審訊、詩意獨白、溫情結語

後三段展示了 TTS 的戲劇性潛力。警探審訊的緊張感、詩意獨白的溫柔、結尾的溫情收束——全部在同一個模型裡完成,不需要更換引擎。

凱潔總結了最佳做法:「更好的方式是直接將 Gemini 官方文檔發給你的 AI Agent,讓它幫你挑選音色再去生成。一個完整的提示詞應該包括場景描述、角色設定、語言選擇和語氣說明。」

與 Hermes Agent 整合實戰

凱潔最後展示了如何透過 Hermes Agent 來使用 Gemini 3.1 Flash TTS,從基礎應用到進階技巧提示詞一次講清:

  1. 將 Google 官方博文發給 Hermes,讓它生成概覽頁面
  2. 詢問「原生多說話人對白是怎麼實現的」,Hermes 自動打開瀏覽器查閱文檔並解答
  3. 問 TTS 是否支援語音克隆——Hermes 搜尋後回答「不支援」,並推薦 Google 另外兩個獨立產品
  4. 將排行榜截圖發給 Hermes,請它辨識第一名公司——答案是 ElevenLabs
  5. 最後讓 Hermes 直接調用 Gemini 3.1 Flash TTS 生成一段示範音頻(有趣的中文笑話、兩個角色),20 秒的音頻順利生成
  6. Hermes 還自動建立了 Gemini TTS 的 skill,方便下次直接使用

凱潔對這個整合非常滿意:「Hermes 調用 TTS 的一系列操作非常流暢,而且還幫我把流程存成 skill,下次用的時候就不用從頭來了。」

QA 精選

Q1:Gemini 3.1 Flash TTS 跟 ElevenLabs TTS 1.5 Max 比,差在哪裡?

根據凱潔展示的排行榜,ElevenLabs TTS 1.5 Max 仍是品質最高的選項,但 Gemini 3.1 Flash TTS 緊追在後,排名第二。主要差異在於價格——ElevenLabs 的收費較高,而 Gemini 的 API 價格僅約 $0.3 美元/10 分鐘音頻,而且免費用戶每天有 10 次免費調用額度。對於預算有限的小團隊或個人開發者來說,Gemini 的 CP 值明顯更高。

Q2:多說話人對白要怎麼設定?需要後期剪輯嗎?

完全不需要後期剪輯。Gemini 3.1 Flash TTS 原生支援最多兩個角色的自然對話,只要在文本中用中括號標註角色標籤,模型就會自動切換對應的音色。凱潔示範的六段音頻中,從雙人笑話到警探審訊場景都是純文字控制,完全不需要音頻剪輯軟體。

但要注意一個關鍵細節:標籤建議用英文撰寫。如果用中文標籤,模型有時會把標籤文字也朗讀出來,破壞聆聽體驗。

Q3:支援哪些語言?中文效果如何?

Gemini 3.1 Flash TTS 支援 70 多種語言,全球化做得非常好。中文效果從凱潔的 Demo 來看相當自然,無論是日常對話、搞笑段子還是詩意朗讀,語氣轉換都很流暢。凱潔也特別提醒,如果需要生成中文內容,描述場景時用中文寫,但標籤建議維持英文。

Q4:語音克隆支援嗎?可以上傳自己的音色嗎?

不支援。凱潔特別問了 Hermes 這個問題,得到的答案是目前 Gemini 3.1 Flash TTS 不提供語音克隆功能,也不支援上傳自訂音色。如果需要這些功能,Google 有另外兩個獨立的產品可以滿足。目前 Gemini TTS 提供了 30 種語音選項,足夠大部分應用場景使用。

主編隨筆

凱潔這集的內容對技術開發者來說相當實用,因為她不只是介紹功能,而是完整示範了從提示詞設計到實際整合的全流程。

不過我觀察到一個值得補充的面向:Gemini 3.1 Flash TTS 的多說話人對白功能雖然很強,但在實際產品應用中,純文字標籤控制有一個容易被忽略的限制——你無法精細控制每個角色的「說話速度」和「情緒強度」。例如警探審訊場景中,語氣從平穩到激動的過渡,目前只能透過提示詞中的場景描述來間接影響,無法像 ElevenLabs 那樣提供細粒度的參數微調。

對於需要高度情緒變化的場景(有聲書、廣播劇),建議先用 Gemini 生成基礎音軌,再搭配專業音頻軟體做後製微調。而對於常見的應用場景——有聲文章、語音助手、客服語音——Gemini 的效果已經非常夠用,而且價格優勢明顯。

另外,凱潔展示的 Hermes 整合很聰明。把 TTS 流程封裝成 skill 的做法,讓日後重複調用變得極度方便,這是很多人忽略了的工作流優化。

結語

Gemini 3.1 Flash TTS 在品質與價格之間找到了非常好的平衡點。對於預算有限但需要高品質語音生成的團隊來說,它是最值得關注的新選項。凱潔在影片中完整覆蓋了從基本功能到進階整合的全部流程,無論是新手還是老手都能從中獲得實用資訊。

如果你正在選型 TTS 方案,建議先在 Google AI Studio 免費試用 Gemini 3.1 Flash TTS,確認效果符合需求後再導入 API。對於多說話人場景和一鍵整合,這款模型是目前 CP 值最高的選擇。

本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款