
NiceKate AI:Gemma 4 12B 本地實測 — MTP 加速翻倍、中文語辨仍有瓶頸
K 實測 Google Gemma 4 12B 多模態模型,從 MTP 加速到中文語音辨識全方面評測,結論是輕量級小模型完成度不錯,但中文支援仍在路上。
開場閒聊
K 一開場就興奮地說,Google 終於推出了 Gemma 4 12B 多模態模型。
她提到這款模型支援視覺和音頻輸入,而且定位非常清楚——目標是讓消費級筆記型電腦也能流暢運行。
K 開玩笑說:「12B 參數的模型能跑在 16GB 記憶體的筆電上,這在一年前根本不敢想。」
她也坦言,雖然期待很高,但實際測試後發現不少問題,尤其中文語音辨識讓她有點失望。
懶人包速覽
| 核心痛點 | 關鍵觀點 |
|---|---|
| 想跑本地模型但硬體預算有限 | Gemma 4 12B 可在 16GB VRAM 的消費級筆電上運行 |
| MTP 加速是否真有感 | 推測解碼讓輸出速度翻倍,BS5 綜合表現最佳 |
| 官方 Mac App 到底好不好用 | 三個官方應用程式都不夠成熟,中文語音辨識尤其差 |
| 中文語音辨識品質 | 中文轉錄品質極差,繞口令測試幾乎全錯 |
我花了大約半小時看完 K 的這集實測。她從硬體需求一路測到翻譯、前端生成、語音辨識,覆蓋了輕量級本地模型的各種使用場景。這篇文章幫大家整理出 5 個最關鍵的發現,並附上我個人的補充分析。
Gemma 4 12B 的架構亮點
Gemma 4 12B 的架構非常特別。傳統多模態系統通常先用獨立的視覺或音頻編碼器,把輸入轉成中間表示,再交給語言模型處理。
而 Gemma 4 12B 嘗試讓視覺和音頻輸入直接進入 LLM 的主幹,從而降低多階段處理帶來的延遲和記憶體開銷。
K 特別提到,這款模型在多個基準測試上的能力已經超過了 Gemma 3 27B,參數量卻不到一半。這代表 Google 在模型架構上的迭代速度確實很快。
音頻路徑也進一步簡化。不過 K 在後續實測中發現,簡化架構的好處和代價需要分開來看。
MTP 加速實測:推測解碼的實戰表現
MTP(Multi-Token Prediction)是 Gemma 4 12B 最重要的新功能。K 在自己的 Mac 上做了詳細的 benchmark。
在沒有 MTP 的情況下,輸出速度大約是 30.5 tokens/s。
換成 BS5 之後,輸出速度提升到約 60 tokens/s,整整翻了一倍。這個提升非常明顯。
K 進一步測試了不同提示詞長度下的表現:
- PP4096 + MTP BS5:Decode 速度翻倍,總耗時明顯縮短
- PP8K + MTP BS5:雖然 Decode 接近翻倍,但 Prefill 變慢很多,總耗時反而比沒 MTP 時更長
她最後給出實用建議:如果你的典型任務是長提示詞、短輸出,MTP 不一定划算;但如果是短提示詞、長輸出,MTP 帶來的加速就很可觀。
K 最終選擇了 BS4 搭配自己的 WebUI 來使用,在實際對話場景中輸出流暢度有明顯提升。
Mac 官方應用:三個都不夠成熟
Google 為 Mac 用戶提供了三個官方應用程式,但 K 全部測過後直言「都不好用」。
Gemma App:下載安裝後可選擇模型,但開啟思考模式後速度極慢,還會導致電腦卡頓。
Edge 整合:音頻和圖片識別功能中,模型選擇居然不支援 12B 版本,只能使用 2B 模型。
Eloquent App:最接近 WhisperFlow 的使用體驗,支援雙擊 Command 喚醒語音輸入。但對中文的識別效果很差,而且設定中選擇 12B 模型後不會立即保存,下次使用時又跳回 2B。
K 也吐槽了一點:下載安裝 Eloquent App 後,設定頁面會強制要求先下載一個 2B 模型,不允許只下載 12B。這種設計對只想用大模型的用戶來說非常困擾。
本地部署實戰:MLX + 自製 WebUI
由於官方應用體驗不佳,K 選擇了自行部署方案。
她使用的是 MLX 社群的 12B IT 8bit 量化模型。因為要啟用 MTP,還額外搭配了一個 Gemma2 12B IT Assistant 8bit 模型(作為推測解碼的輔助模型)。
部署框架選擇的是 MLX VLM,搭配 MLX VLM Server 運行。
K 特別說明為什麼沒有選擇 Ollama 或 LM Studio:因為 Gemma 4 12B 支援音頻處理,這兩個平台可能無法立即支援最新的音頻功能。而 MLX 在 Mac 上的運行速度也相對更快。
她還自己寫了一個 WebUI 前端,最終成功讓模型在本地運行並處理音頻輸入。
這個部署路線對有一定技術背景的 Mac 用戶來說是最推薦的方式。
實際能力測試:亮點與槽點並存
K 做了多項實際測試,涵蓋不同任務類型:
圖片理解:表現相當不錯。無論是描述圖片內容、反推提示詞還是複刻網頁,都有一定水準。
翻譯測試:將文本翻譯成三種小眾語言,並請 Gemini 3.5 Flash 評分。芬蘭語 8.5 分,冰島語只有 2 分,喬治亞語 2.5 分。小眾語言翻譯確實不是強項。
故事創作:要求寫一個包含至少 10 個反轉的 200 字故事,Gemini 評分 8.5 分,但指出反轉數量只有 8 個、套路相對單一。
前端生成:複刻髮型應用頁面、兵馬俑跳街舞動畫、無限循環催眠動畫。K 對前端能力的評價是「超過預期」,尤其在小模型上能做出高品質的頁面令人驚艷。不過不提示的話模型會偷懶只生成一個場景。
推理測試:愛因斯坦諾貝爾獎年份相關問題(1921 年獲獎)Gemma 4 12B 答錯,顯示推理能力仍有提升空間。
QA 精選
Q1:Gemma 4 12B 的硬體門檻到底多低?
K 在影片中實測使用的是 Mac 電腦搭配 16GB 統一記憶體,運行 12B 8bit 量化模型完全可行。
不過她強調,如果想要順暢使用 MTP 加速,需要額外加載一個推測解碼輔助模型,記憶體需求會再增加一些。對一般消費者筆電來說,2B 模型會是更保險的選擇。
Q2:MTP 加速真的能讓輸出翻倍嗎?
根據 K 的 benchmark 數據,在理想條件下(短提示詞、長輸出),MTP BS5 確實可以讓輸出速度從 30.5 TPS 提升到約 60 TPS。
但她也特別指出一個重要前提:提示詞長度超過 8K 時,Prefill 時間會顯著增加,導致總耗時反而比不使用 MTP 更慢。所以 MTP 不是無條件加速,需要根據使用場景選擇是否啟用。
Q3:官方 Mac App 真的完全不能用嗎?
K 的結論是「對中文用戶來說幾乎不可用」。三個應用程式各有各的問題:速度慢、不支援 12B 模型、中文語音辨識極差。
其中 Eloquent App 的英文語音辨識其實不錯,但如果想用中文語音輸入,K 建議直接跳過官方方案。
Q4:中文語音辨識為什麼這麼差?
Gemma 4 12B 在音頻路徑上做了簡化設計,但這似乎是以犧牲中文語音辨識品質為代價。
K 做了繞口令測試:「牛郎戀劉娘,劉娘戀牛郎」——模型幾乎全部辨識錯誤。她認為這可能與訓練資料的中文音頻比例不足有關。
Q5:這個模型最適合什麼樣的應用場景?
根據 K 的測試,Gemma 4 12B 最適合的場景是:需要本地運行的輕量級多模態任務,特別是圖片理解和簡單的前端生成。
K 尤其推薦它的圖片反推提示詞功能,以及網頁複刻能力。對於需要快速原型設計的開發者來說,這是一個不錯的本地工具。
Q6:和小模型 Gemma 3 27B 比起來如何?
K 提到 Gemma 4 12B 在多個基準測試上已經超越 Gemma 3 27B,參數量卻少了一半以上。
不過她也在實測中發現,特定任務如推理測驗和小眾語言翻譯,Gemma 4 12B 的表現並不算出色。所以「超越」的結論需要看具體任務而定,並非全面碾壓。
主編隨筆
K 對 Gemma 4 12B 的實測非常全面,從硬體門檻到各種任務的實際表現都覆蓋到了。但我覺得有一個值得補充的觀點。
K 在影片中主要從「技術使用者」的角度出發,測試重點是模型能不能跑、跑多快、哪些任務表現好。但從「產品化應用」的角度來看,Gemma 4 12B 的定位其實很有意思——它是目前極少數能把視覺、音頻、語言三種模態同時塞進 12B 參數且能在消費級硬體上運行的模型。
這對開發「邊緣裝置上的 AI 代理」來說意義重大。想像一下,一台筆電就能同時理解圖表、聆聽語音指令、生成回覆,而不需要網路連線。雖然中文語音辨識現在是瓶頸,但這是一個架構層面的問題,隨著訓練資料的補強,後續版本很有可能快速改善。
以我自己部署本地模型的經驗來說,Gemma 4 12B 的 MLX + MTP 方案已經達到「日常可用」的水準了。對於不想依賴雲端 API 的開發者,這確實是一個值得花時間嘗試的方向。
結語
Gemma 4 12B 是一顆值得關注的輕量級多模態模型。它在圖片理解和前端生成上表現出色,MTP 加速在合適場景下確實有效。
但中文語音辨識、推理能力和小眾語言翻譯仍是明顯的短板。K 的建議很中肯:如果你有本地部署的需求,可以試試看,但要管理好期待——它在某些任務上會讓你驚艷,在某些任務上則會讓你哭笑不得。
對開發者來說,MLX + WebUI 的自建方案是目前最好的使用體驗。期待 Google 在後續版本中改善中文支援和官方應用的完成度。
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









