
NiceKate AI:Mac 本地跑 Qwen3.6-27B — 4bit 竟能 40+ tok/s?四種方案實測
凱特實測四種在 Mac 上運行千問 3.6-27B 的方案,從官網、GGUF、MLX+Dflash 到 MTPLX,發現 MTPLX 四比特的生成速度翻倍達 43.6 tok/s,是最適合 Mac 用戶的選擇。
開場閒聊
凱特一開場就說這期影片準備了非常久,因為要在 Mac 本地跑 Qwen3.6-27B,真是折騰了不少時間。
她笑著說:「Mac 端和 Windows 端很不一樣,Windows 用戶可以透過 3090、4090 輕鬆跑,但 Mac 上選擇實在太多太多了。」從 LM Studio、Ollama、Unsloth Studio 這些舊方案,到新款 OMXL、Dflash MLX、MTPLX,她一一嘗試,最終找到了讓生成速度翻倍的秘密武器。
她還提到,為了測試這些方案,她不只自己摸索,還透過 Groq 搜尋大量社群討論與 Twitter 上的第一手資訊。整個過程就像一場 Mac 本地部署的大型實驗。
懶人包速覽
| 核心痛點 | 解決方案與關鍵觀點 |
|---|---|
| Mac 上跑 Qwen3.6-27B 速度慢,選擇多到不知怎麼選 | 直接選 MTPLX 四比特,安裝簡單、速度最快 (43.6 tok/s) |
| 傳統 GGUF 和 MLX 方案速度只有 18-22 tok/s,還有風扇噪音 | MTPLX 讓速度翻倍,而且安靜流暢,不需要忍受「呼啦呼啦」的風扇聲 |
| 官方網站體驗好但 coding 任務有穿模、渲染錯誤 | 本地部署的 MTPLX 在生成複雜場景時表現非常出色(羊理髮店、3D 場景) |
| 想要高品質但又怕本地模型質量縮水 | MTPLX 四比特的輸出品質很不錯,還有更高品質的版本可選,編碼與寫作都表現良好 |
這篇是凱特花了很多心力準備的四種方案實測內容,如果你也是 Mac 用戶,正在煩惱如何在本機上跑千問 3.6-27B,這篇文章會幫你省下大量試錯時間。我整理出四種方案的優缺對比,並附上我自己的安裝經驗補充。tok/s?四種方案實測結果顯示,MTPLX 以壓倒性速度勝出。
Qwen3.6-27B:旗艦級本地模型的誕生
千問 3.6-27B 是上個月(2026年4月)發布的旗艦級模型,定位是可以在本地運行的高性能智能體編程助手。凱特特別強調,它的編碼能力相當強悍,無論是 SWE-bench Verified 還是 SWE-bench Pro,成績都超越了前代 397B MoE 的旗艦模型。
除了編碼,它在文檔理解、VQA、視頻理解、視覺智能體方面也非常出色。目前最簡單的體驗方式就是透過千問 Studio 官網,那是部署最好的版本。但對於想本地部署的用戶來說,Mac 上的選擇就非常多元了。
凱特指出:「27B 的模型來挑戰前代 397B MoE 的旗艦模型,這本身就是一件很值得關注的事。」
四種方案橫向對比
方案一:Qwen 官網(Web 體驗)
官網版本是最穩定、最完整的,但凱特用它測試了幾個視覺生成任務,發現了一些有趣的問題。
她讓千問做「千福拉船」,結果船從山體裡面跑出來,部分場景的植物漂在空中。復刻遊戲畫面時,雲朵樣式與原圖不太一致,十字路口的車輛方向和線柱位置也有穿模現象。3D 模型模擬器也出現了一些 bug。
不過凱特也觀察到,模型在思考架構上確實很充分——控制面板、實時統計數據的設計維度很多,禮物包裝智能助手還能提供包裝盒尺寸建議,這些細節顯示出模型的思考能力很強。
方案二:Unsloth UDQ5 GGUF(18 tok/s)
凱特最初嘗試的是 Unsloth 推出的動態量化 Q5 GGUF 格式模型,生成速度大約是 18 tok/s。她在電腦上跑的時候,風扇發出「呼啦呼啦」的聲音,整體體驗不算理想。
不過她測試了這個方案做的一些生成任務——倉庫分揀模擬系統、千福拉船等。雖然有畫面閃爍、部分物體沒有正確動起來的問題,但她認為 27B 在這裡的思考深度確實不錯。
方案三:Unsloth MLX 6bit + Dflash MLX(22 tok/s)
接下來凱特嘗試了 Unsloth 的 6bit MLX 版本,並搭配 Dflash MLX 一起使用。生成速度提升到 22 tok/s,但仍然不算快。
Dflash 是專門為蘋果晶片開發的原生 MLX 端口,可以加速推理。她透過 Groq 查了很多關於 Dflash 的資料,發現社群版的 Dflash MLX 比官方 Zlab 版更成熟。不過 Dflash 有個限制——無法選擇模型的溫度參數,這對需要區分寫作與編碼不同溫度的場景來說是個麻煩。
她請 Groq 幫她做了一份從零到一的安裝流程,並請 Groq 改成 UV 管理。最後順利把模型接入了 Open WebUI,但整體速度還是讓她不太滿意。
方案四:MTPLX 4bit — 冠軍方案(43.6 tok/s)
MTPLX 是凱特最終找到的最佳方案。誰能想到 4bit 竟能 40+ tok/s 呢?四比特(4bit)的模型在她的 Mac 上竟然能達到 40+ tok/s,最高測到 43.6 tok/s,比前面幾種方案快了將近一倍!
安裝也很簡單:先用 brew install,然後執行 mtplx start,選擇預設的 Speed 模型,接著選擇預設模式,最後可以透過 WebUI、CLI 或 OpenCode 等方式對話。
凱特用 MTPLX 四比特測試了多個生成任務:
綿羊理髮店是她最滿意的作品。小羊頭上有蝴蝶結,理髮師正在幫綿羊理髮,腿部格子設計美觀,深紅色沙發效果也很棒。整個畫面的物體位置擺放和細節都相當不錯。稍微可惜的是窗戶和門重合在一起。
體素藝術騎自行車的畫面中,腳踏車確實動了起來,但更像是摩天輪在轉而不是往前騎。不過下方的道路清晰可見,畫面內容豐富。
禮物包裝智能助手的介面也很精緻——點擊不同禮物,右側會出現對應的預覽,下方還有場合選擇器,不同場合對應不同包裝紙。
不過凱特也坦承,這個模型目前沒有視覺能力,這是它與官網版本的主要差距。
MTPLX 安裝快速入門
MTPLX 的安裝流程非常簡單,凱特在影片中詳細說明了步驟:
brew install mtplxmtplx start— 會進入互動式命令- 選擇 Speed 模型(預設,也是下載量最大的版本)
- 選擇預設模式
- 透過 WebUI 或 CLI 開始對話
安裝完成後,Open WebUI 會自動識別出 MTPLX,不需要額外設定。左側可以調整模型參數——編碼時建議用 0.6 溫度,一般任務則用 1.0。
MTPLX 還有更高品質的版本可以下載,適合對生成品質有更高要求的用戶。
QA 精選
Q1:MTPLX 四比特的生成品質會比高比特版本差很多嗎?
凱特的實際測試顯示,MTPLX 四比特的輸出品質相當不錯。她製作了綿羊理髮店、體素藝術自行車、禮物包裝助手等複雜場景,多數都能呈現出合理的物件擺放和細節。開發者 Iven 也在數學基準測試中取得了 93.3% 的正確率。不過 MTPLX 也提供更高品質的版本,對品質有極高要求的用戶可以自行下載。
Q2:Mac 上跑千問 3.6-27B,哪種方案最推薦?
凱特明確推薦 MTPLX 四比特。原因有三:一是安裝最簡單,幾條指令就能搞定;二是速度最快(43.6 tok/s),比第二快的 MLX+Dflash(22 tok/s)將近翻倍;三是輸出品質在水準之上。目前唯一的限制是 MTPLX 還不支援視覺能力,如果需要多模態功能,還是得用 Qwen Studio 官網或 GGUF 方案。
Q3:Dflash MLX 對生成效率的影響是什麼?
Dflash MLX 使用一個小型的 Draft 模型來輔助推理,目的是以少量額外資源換取速度提升。凱特在測試中發現,Dflash 的接收率不是 100%,但整體上確實有加速效果。不過 Dflash 無法調整模型的溫度參數,這對需要區分寫作和編碼溫度的使用場景來說是個限制。而且 Dflash 的安裝設定相對複雜,需要較多前置工作。
Q4:這些方案在 Open WebUI 上都能用嗎?
凱特實際測試後確認,MTPLX 可以無縫接入 Open WebUI,會自動被識別且不需要額外設定。而 Unsloth MLX 6bit 搭配 Dflash 的方案,她則是把 Groq 生成的流程發給 AI Agent(Codex 或 Claude Code)來協助安裝和除錯。不過在接入過程中她遇到了一些響應問題,最後也是靠 AI 快速解決的。
Q5:Mac 上跑 27B 模型,16GB 記憶體夠不夠?
凱特在使用 MTPLX 四比特 Speed 模型時,並未提到記憶體不足的問題。Qwen3.6-27B 四比特量化後的模型大小約在 15-18GB 左右,因此建議至少有 24GB 以上的統一記憶體(Unified Memory)會比較順暢。如果記憶體較少,可以考慮 MTPLX 的 Speed 模型(經過特別優化)或使用更低的量化位數。
主編隨筆
凱特這期內容讓我想起一個經常被忽略的重點:本地模型的部署體驗,往往不只是「哪個模型最強」的問題,而是「哪個方案最適合你的硬體與 workflow」。
從 18 tok/s 的 GGUF 到 43.6 tok/s 的 MTPLX,速度差距超過兩倍,但模型本身是同一顆 Qwen3.6-27B。這說明在 Mac 生態中,推理框架的選擇對實際體驗的影響,可能比模型本身的選擇還大。
我自己的經驗是,很多開發者花了太多時間在比較模型之間的基準分數,卻忽略了推論後端這個變數。一個優化良好的後端,可以讓同一顆 27B 模型的體驗從「勉強能用」變成「流暢順手」。MTPLX 的例子正是最好的證明——同樣的模型參數,換一個框架就能讓速度翻倍。
如果你也是 Mac 用戶,我的建議是:不要急著追逐最新最強的模型,先把手邊的 Mac 環境調校好。一個好的推理框架,比多花幾百億參數更有感。凱特的實測剛好給出了一個很清楚的 roadmap,照著走就能省下數小時的試錯時間。
結語
凱特在四個渠道完整實測了千問 3.6-27B:官網、Unsloth 五比特 GGUF、Unsloth MLX 六比特搭 Dflash、以及 MTPLX 四比特。最終 MTPLX 以安裝簡單、速度快近一倍、輸出品質在線的綜合表現獲得冠軍。
不過她也誠實地說明了 MTPLX 的限制——目前沒有視覺能力。如果你需要多模態功能,可能還是要回到官網版本或其他方案。
對於想試試本地 AI 的 Mac 用戶來說,這支影片提供了一個非常實用的實戰指南。從選擇框架到安裝流程,再到實際生成效果展示,看完就能直接上手。正如凱特所說:「非常推薦大家在本地去使用它。」
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









