
NiceKate AI:实测 DeepSeek V4 Pro,惊喜和不足
傑德實測 DeepSeek V4 Pro,從寫作、程式到論文解讀完整分析。V4 Pro 在 SW-bench 超越 GPT-5.5,但知識類任務仍不及 Gemini 3.1 Pro。深入解讀 CSA/HCA 注意力機制與 Magic MOE 工程創新。
開場閒聊
傑德一開場就說:「DeepSeek V4 終於發布了,很多人早就等不急了。」
他提到這次 V4 推出了兩個型號:V4 Pro 和 V4 Flash,其中 Pro 版本號稱性能比肩閉源模型。他笑著說:「世界知識特別好,因為模型量比較大嘛,數學、競賽型編碼的測評中,已經超越當前所有已公開評測的開源模型了。」
語氣中帶著對開源社群進展的興奮,但也透露了一絲保留——畢竟他在後續實測中發現了不少問題。
懶人包速覽
| 核心痛點 | 解決方案 / 關鍵觀點 |
|---|---|
| DeepSeek V4 Pro API 價格太高,實測起來划不划算? | API 價格比 MiMo V2.5 Pro 和 GLM 5.1 貴,但 DeepSeek 預估下半年升騰 950 晶片量產後價格會大幅下降 |
| V4 Pro 的寫作能力真的追上 GPT-5.5 了嗎? | 創意寫作不相上下,但深入分析能力 GPT-5.5 更強,思考時間也更長,兩者定位不同 |
| V4 Pro 在程式生成上的表現如何? | 前端生成堪用,但細節錯誤不少(船嵌入岸邊、建築物在道路上、車輛撞擊),還不到穩定生產級 |
| DeepSeek V4 論文提到的 CSA/HCA 是什麼? | CSA 是壓縮後再找重點的檢索式注意力,HCA 是全局摘要式注意力,兩者分工讓百萬 token 上下文變為可常態使用的工程能力 |
今年 4 月 DeepSeek 正式釋出 V4 系列模型,傑德在第一時間做了全面實測。從寫作到程式,实测 DeepSeek V4 Pro,惊喜與不足都很明顯——編碼評測超越 GPT-5.5,但前端生成的細節錯誤依然不少。
這篇文章幫大家整理出三個關鍵面向的測試結果,並附上論文中 CSA/HCA 注意力機制與 Magic MOE 工程架構的解讀,幫助你判斷 V4 Pro 到底值不值得用。
DeepSeek V4 發布亮點:兩個型號、一個論文
DeepSeek V4 系列包含 V4 Pro 和 V4 Flash 兩個模型。V4 Pro 的亮點在於全新的注意力機制設計,以及在 SW-bench 等編碼評測上超越所有已公開評測的開源模型。
傑德指出,DeepSeek 這回還特別介紹了模型的 Agent 能力。在使用上,Base URL 保持不變,但 Model 參數需要改為 DeepSeek V4 Pro 和 V4 Flash。原有的 Chat 和 Reason 模型將在三個月後停止使用。
API 定價方面,V4 Pro 目前不算便宜。傑德請 AI 整理了 MiMo V2.5 Pro、K2.6、GLM 5.1 的價格做對比,「如果用編程的話,想要採用 DeepSeek V4 Pro API,那還是比較貴的」。不過 DeepSeek 在論文中也提到,預計下半年升騰 950 超級晶片批量上市後,Pro 的價格會大幅下降。
寫作能力實測:DeepSeek V4 Pro vs GPT-5.5
傑德設計了多個寫作任務來比較 V4 Pro 和 GPT-5.5。
第一個任務是「將他很難過,改成一句有畫面感的話,不超過 30 個字」。V4 Pro 思考了 30 秒後給出:「他站在那裡,像一顆被雨凝透的樹。」GPT-5.5 則回覆:「他低著頭,眼淚砸在鞋尖上。」傑德坦言更喜歡 GPT-5.5 的表達。
第二個任務是寫一條咖啡店新品廣告語,要求高級但不油膩。V4 Pro 提供了多個方案讓使用者選擇,GPT-5.5 只寫了一句。傑德認為 V4 Pro 在創作類任務上給更多選項是優點。
第三個任務是寫 100 字以內的小故事,結尾必須反轉。V4 Pro 寫了咖啡店暗戀盲人顧客的故事,GPT-5.5 則寫了失蹤妻子的書信故事。傑德覺得兩個故事都有張力,算平手。
不過在深入的模型分析任務上,差距就出來了。當傑德要求兩個模型分析 V4 Pro 相較於 Opus 4.7 和 GPT-5.5 在 Generic Coding 上的優勢時,V4 Pro 的回答沒能查到自己的 SW-bench Pro 得分。GPT-5.5 思考了近兩分鐘後,給出了結構完整的分析——「DeepSeek V4 Pro 核心優勢不是絕對能力超過 Opus 4.7 或 GPT-5.5,而是以顯著更低的 Token 成本、開放權重、1M 上下文和較高的輸出上限,提供接近前沿閉源模型的 Generic Coding 能力」。傑德對此評價:「他這塊說得太好了,這就是 DeepSeek 非常大的一個優勢。」
程式與前端生成:亮點與問題並存
傑德在程式測試部分,先讓 V4 Pro 做一個欠費拉船的場景。
「我們放大看的話,水面表現得不錯,但是這個船是有問題的,它是嵌入到岸邊的。」傑德指出,V4 Pro 有一個優點——船透過繩索連接到前後端,這比其他模型做得好。但整體來說,細節的準確度還不夠。
接著測試馬卡龍的春色花園,V4 Pro 初次生成的頁面完全無法顯示。經過一次修改提示後,左側依然沒有花朵或蝴蝶的裝飾元素。
十字路口交通仿真的問題更明顯。V4 Pro 思考了五分鐘後,生成的場景多了很多建築,部分建築直接放在道路上,還出現車輛撞擊的情況。傑德直言:「V4 Pro 在這個任務上是有很多錯誤的。」
提壺自行車的提書藝術測試中,提壺的細節不是特別明顯,連眼睛都沒有。不過傑德也給了正面評價:「提壺下方騎的這個自行車挺有動感的,效果不錯。」
數位平台的生成算是亮點之一。V4 Pro 生成了一個具有古代畫卷風格的書寫平台,支援筆觸、換色、檸檬回放和不同花紋選擇。傑德說:「功能是沒有最近我測試一些其他大模型功能那麼多,但我個人覺得它生成的這個界面我還是挺喜歡的,有這種古代畫卷的感覺。」
復古膠片相機模擬器則中規中矩。按下快門後跳出上傳文件的彈窗,上傳圖片後可以看到不同相機的濾鏡效果。傑德特別提到,V4 Pro 的思考時間遠小於 MiMo V2.5 Pro,「我認為這一點也是 DeepSeek 非常大的一個優勢。」
最後的禮物包裝 3D 助手展示是最亮眼的成果。V4 Pro 生成了帶有絲帶凸起質感的 3D 效果,換成圓柱體、愛心形狀都不錯,還能更換包裝紙、展開圖和絲帶搭配方式。傑德給了很高的評價:「這裡做的裁剪線看著也不錯。」
論文重點解讀:CSA、HCA 與 Magic MOE
DeepSeek 同時發布了 V4 技術論文,標題翻譯為「邁向高效率的百萬 token 上下文智能」。
傑德強調,這篇論文最重要的點不是模型變大了,也不是上下文窗口拉到 100 萬 token —— 而是「當模型開始支援更長思考、更長對話、更複雜的 Agent 工作流時,怎麼讓百萬 token 上下文變成一個可以常態化使用的工程能力,而不是一個展示型參數」。
CSA:檢索式注意力
CSA(Compressed Sliding Attention)的原理是先將 KV Cache 沿著序列維度壓縮,再從壓縮後的內容中找重點。在 V4 的配置中,CSA 的壓縮率 M 等於 4。
HCA:全局摘要式注意力
HCA(Hierarchical Compressed Attention)則是以全局顆粒度進行摘要,極大壓縮序列,讓模型依然保留長距離上下文的信息。論文也意識到壓縮會損失局部細節,因此在 CSA 和 HCA 旁邊都加了滑動窗口分支作為補償。
Magic MOE 工程優化
論文花了相當篇幅介紹系統工程層面的創新。Magic MOE 將 MOE 的通信和計算融合在更細粒度的流水線中;EP 方案則是將 Expert 分成多個 Web 調度,讓通信、計算、Activation 和 Combine 盡可能重疊。論文給出的理論加速是 1.92 倍。
訓練流程與評測
V4 的訓練從 4K 序列長度開始,逐步拓展到 16K、64K,最後到 1M。後訓練流程分為四步:SFT 打底、GRPO 專家訓練、GRM 判分、OPT 合併。論文使用了超過 10 個教師模型,透過蒸餾方式將不同專家能力合併到一個統一模型裡,這也解釋了為什麼 V4 有不思考、思考 High 和 Max 三檔模式。
評測方面,V4 Pro Max 在 CodeForces rating 上高於 GPT-5.5 High 和 Gemini 3.1 Pro。但論文也坦承,知識類任務上 V4 Pro Max 雖然顯著超過開源模型,和 Gemini 3.1 Pro 還是有差距。中文白領任務整體勝率為 63%,但在複雜指令和多人中文寫作上,目前 V4 仍不如 Claude Opus 4.5。
QA 精選
Q1:DeepSeek V4 Pro 的 API 價格那麼貴,什麼時候會降價?
DeepSeek 在論文中有明確說明,預計 2026 年下半年升騰 950 超級晶片批量上市後,Pro 版本的價格會大幅下降。目前 V4 Pro 的 API 定價比 MiMo V2.5 Pro 和 GLM 5.1 都貴,短期內如果想省錢,可以先用 V4 Flash 版本試水溫。
傑德也提醒,V4 Pro 雖然價格高,但其思考時間遠比 MiMo 模型短,這在大量調用場景下能節省不少運算成本。
Q2:V4 Pro 的程式生成能力能不能用在生產環境?
從傑德的實測來看,目前還不建議直接用 V4 Pro 做生產級的前端開發。
十字路口交通仿真出現建築物擋路、車輛撞擊的問題,馬卡龍春色花園也無法正確渲染。但在簡單的 3D 場景(如禮物包裝助手)和風格化數位平台上,V4 Pro 的表現相當不錯。比較適合用在原型設計和概念驗證階段,需要人工 review 後才能上線。
Q3:V4 Pro 的寫作能力跟 GPT-5.5 比誰強?
兩者各有勝場。創意寫作(小故事、廣告語)方面兩者實力相當,V4 Pro 還有一個優勢是傾向提供多個方案讓使用者選擇。
但在需要深入分析、查證資訊的任務上,GPT-5.5 明顯更強。傑德的測試中,GPT-5.5 能夠自行搜尋並引述 SW-bench Pro 的具體得分,V4 Pro 則無法查到自己的公開評測數據。此外 GPT-5.5 的思考時間更長(近 2 分鐘),分析也更深入全面。
Q4:V4 論文提到的 CSA 和 HCA 對一般開發者有什麼實際意義?
最大的實際意義是:百萬 token 上下文不再只是展示用的參數,而是可以常態使用的工程能力。
對於開發者來說,這意味著可以將更大範圍的程式碼庫、更長的文件直接送進模型處理,而不用擔心上下文不足或成本爆炸。CSA 讓模型壓縮後再找重點,HCA 保持全局視野,兩者分工讓長上下文的計算和儲存成本實質性地降了下來。
V4 的模型架構雖然複雜(為了極限效率保留了許多技巧),但從使用者的角度,API 呼叫方式不變,直接受益於更長的上下文和更低的推理成本。
主編隨筆
傑德在影片中花了大量篇幅比較 V4 Pro 和 GPT-5.5 的文字創作,這對內容創作者確實有參考價值。但從開發者的角度來看,V4 Pro 真正的殺手級應用其實在論文裡——不是模型能力本身,而是「把百萬 token 成本壓到可日常使用」這件事。
過去一年我反覆遇到的困擾是:想把整個專案的程式碼庫餵給模型做重構,但常常在幾萬 token 就卡住,不是超出上下文就是 API 帳單爆表。V4 的 CSA/HCA 設計從架構層面解決了這個問題——不是硬拉視窗,而是用檢索 + 摘要雙通道來管理資訊。如果後續開源社群能把 V4 的部署成本再降低,這可能會是 2026 年最影響開發者工作流程的模型之一。
當然論文中也誠實提到架構複雜度偏高、部署門檻不低,這是開源模型追趕閉源必然付出的代價。我個人的判斷是:V4 Pro 適合用在需要大量上下文理解的場景(程式碼重構、長文件分析),但日常對話和簡單任務用 V4 Flash 或 GPT-5.5 更划算。
結語
DeepSeek V4 Pro 是一款讓人又驚又喜的模型。
驚的是它在編程評測上的成績確實亮眼,論文中的 CSA/HCA 架構設計也展現了 DeepSeek 在工程創新上的深厚底蘊。喜的是開源模型正在以前所未有的速度追趕閉源水準——V4 Pro Max 在 CodeForces 評分上已經超越 GPT-5.5 High。
但缺點也很明顯:API 價格偏高、前端生成的細節錯誤不少、知識類任務仍落後 Gemini 3.1 Pro。傑德的測試很誠實地呈現了這些短板,沒有為了流量過度吹捧。
隨著下半年升騰 950 晶片量產,V4 Pro 的價格可望大幅下降。到那時候,開源 vs 閉源的選擇會變得更加有趣。
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









