
NiceKate AI:Qwen3.7-Max 全面實測——寫作、推理、編程實力大檢閱
凱特實測千問 Qwen3.7-Max 的多項核心能力,從多語言翻譯、創意寫作、編程到全端應用開發,看看這款被譽為最強國產模型的表現究竟如何。
開場閒聊
凱特一開場就說,後台已經有多位觀眾要她製作千問 3.7 Max 的評測影片。她準備了多個測試任務,要全面檢驗這個模型的推理、寫作和編程能力。
這次的 7-Max 全面實測橫跨多個維度,從多語言翻譯到全端應用開發都有涵蓋,測試設計的廣度是這次評測的一大亮點。
為了盡量客觀,部分任務還會請 Gemini 和 GPT 模型來當評審打分。
凱特提到,Artificial Analysis 榜單上,3.7 Max 的得分比 3.6 Max 高出不少,目前被認為是最強的國產模型。她笑著說:「在我的實測裡,3.7 比 3.6 進步很大,編程方面也有不少驚喜。」
懶人包速覽
| 核心痛點 | 解決方案 / 關鍵觀點 |
|---|---|
| AI 模型能力眾說紛紜,難以客觀比較 | 凱特設計多樣化測試任務(翻譯、寫作、推理、編程),並請第三方 AI 模型評分 |
| 編程能力是否足以勝任實務專案 | 3.7 Max 在 OpenCode 中十幾分鐘完成全端應用,含完整資料庫與後端邏輯 |
| 模型生成幻燈片品質參差不齊 | 千問 Image 搭配 3.7 Max 的論文解讀幻燈片,內容與論文要點高度一致 |
| 開源模型在創意寫作上表現有限 | 200 字故事包含 11 次反轉,Gemini 評分高達 95 分 |
我花了一段時間仔細看完凱特的這支 Qwen3.7-Max 實測影片,測試項目從翻譯、寫作、編程一路到全端應用開發,涵蓋面非常完整。這篇文章為大家整理出 5 個最重要的測試結果,並附上我自己的操作觀察。
多語言翻譯:小語種也難不倒
凱特的第一個任務是讓千問將一段文字翻譯成三種小眾語言:芬蘭語、冰島語和格魯吉亞語。
她特別請 Gemini 來打分,Gemini 給出了 96 分的高分,認為譯文沒有生硬的機器翻譯感,而是根據三種截然不同的語系特點進行了深度的本地化重構。
凱特認為,這個結果說明了千問 3.7 Max 在多語言理解上具備扎實的功底,而非只是簡單的逐字翻譯。
Gemini 也指出了一些小瑕疵,但整體來說,千問的多語言能力確實很強。
凱特提到她自己在本地也經常使用千問的開源模型來做翻譯,品質一直都很好。
創意寫作:200 字內塞進 11 次反轉
第二個任務是寫一個大約 200 字的短故事,要求包含極多出乎意料的反轉,至少 10 個以上。
Gemini 給出了 95 分,認為故事包含 11 次反轉、首尾呼應、情節緊湊、引人入勝。Gemini 也列出了具體的 11 次反轉分解,並建議如果能用更客觀的視覺或動作描寫來引出反轉,質感會更上一層樓。
凱特分享了一個實用技巧:如果你想讓 AI 幫你寫小說,可以在 AI 寫好之後發給另一個 AI,留意它的優化意見,進而優化你的寫作提示詞,透過 AI Agent 來寫出更好的作品。
幻燈片生成:論文解讀也能勝任
千問用來生成幻燈片也不錯。這次的任務是讓它根據 DeepSeek V4 的論文 PDF,生成一份面向大眾、非科研人士的高品質解讀 PPT。
凱特認為幻燈片本質上還是內容為王,設計沒那麼重要。要讓內容好,就適合搭配一個強勁的模型,所以讓 3.7 Max 來生成解讀幻燈片就很合適。
最終生成的幻燈片內容與論文要點非常一致,千問 Image 的幻燈片模板也已更新,每頁有插圖和要點,圖表運用恰當,整體看起來很舒服。
幻覺檢測與知識準確性
凱特讓千問判斷一段關於愛因斯坦的陳述是否正確:「愛因斯坦在 1938 年獲得了諾貝爾物理學獎,以表彰他對廣義相對論中引力波預言的貢獻。」
千問沒有調用搜索,直接用內部知識回答:愛因斯坦獲得的是 1921 年的諾貝爾物理學獎,獲獎原因是他對理論物理學的貢獻,特別是發現了光電效應定律。回答完全正確。
接著凱特將一篇虛構的論文題目發給千問,讓它查找。經過搜索,千問對該期刊目錄進行了全面檢索,告訴她目前並未發現與該標題完全一致的已發表論文。
這兩個測試說明,對於簡單問題,千問會直接調用內部知識回答;需要搜索的問題,它會調用搜索工具再給出回覆,判斷力相當可靠。
編程能力:從前端動畫到全端應用
千問 3.7 Max 的編程表現是這次測試的亮點。可以說這次的編程實力大檢閱涵蓋了從前端動畫到全端應用的完整光譜,每個任務都展現了不同的能力面向。
凱特讓它生成多個不同的專案:
機械行星儀玩具:一打開頁面就像桌上擺著一件會動的機械藝術品,黃銅質感的行星儀包含 8 個天體繞中心運轉。每顆星球有自己的材質風格(白瓷、羊脂玉、琉璃、黑曜石),點擊星球會彈出名牌介紹,還可以調整運行速度。
音樂作曲可視化:使用 Web Audio 合成音樂和音色,播放時音符像小金屬齒被滾筒撥動,產生光點和震動。一次提示就完成,可以選擇預設旋律播放,也能用滑鼠點擊添加音符,還有六種調式可選。
影子劇場動畫編輯器:用戶可以在舞台上擺放剪影道具、設置關鍵幀製作循環動畫。包含道具庫、時間軸、屬性面板,內建三個預設場景。支援導入導出 JSON,做好的舞台可以保存下來下次繼續編輯。
其中最令人印象深刻的是最後一個測試:在 OpenCode 中用千問 3.7 Max 生成了一個完整的社區節日攤位規劃系統,只花了十幾分鐘。
這個系統包含攤主申請提交、管理員審批後台、攤位地圖拖放安排、位置衝突檢查、電源水源匹配、CSV 數據導出等完整功能。後端還實作了規則校驗,例如需要電源的攤位必須安排在電源點附近,吵雜的攤位不能離觀眾區太近。
凱特讓 GPT-5.5X 來評價這個專案的代碼品質。GPT 給出 demo 完成度 7 分、生產可用性 3.5 分的評分,認為功能閉環完整、技術棧選型合理、有測試意識。同時也指出管理後台缺少真實權限驗證、輸入校驗不夠嚴謹等問題。
凱特坦承,這些問題她自己也有責任,因為她給千問的需求比較寬泛,沒有仔細查看 Plan 就直接讓它編碼了。她建議大家在實踐中,先和模型對齊需求再讓它編碼。
QA 精選
Q1:千問 3.7 Max 跟 3.6 Max 相比進步在哪裡?
凱特實際測試後認為進步非常明顯。在 Artificial Analysis 榜單上,3.7 Max 的得分比 3.6 Max 高出不少,是目前最強的國產模型。編程能力的提升尤為突出,前端頁面的設計質感也有顯著進步。
Q2:千問 3.7 Max 的編程能力足夠應付真實專案嗎?
凱特用 OpenCode 在十幾分鐘內完成了一個社區節日攤位規劃系統,包含完整的資料庫、後端 API、管理後台和前後端互動邏輯。GPT-5.5X 評分認為 demo 完成度 7 分、生產可用性 3.5 分。短期來說,它非常適合快速原型開發;要達到生產等級,還需要人工補上權限驗證、輸入校驗等細節。
Q3:千問的幻覺問題控制得如何?
凱特進行了兩個測試。第一個是事實核驗,千問正確指出愛因斯坦獲得的是 1921 年諾貝爾獎(因光電效應),沒有被錯誤的前提誤導。第二個虛構論文查詢,千問調用搜索工具後回報未找到匹配論文。對於簡單問題它會直接調用內部知識,需要查證的問題則會啟動搜索,判斷力相當可靠。
Q4:千問 3.7 Max 適合哪些使用場景?
官方介紹它的強項在於編碼、辦公生產力與工作流自動化,以及長週期自主執行能力。凱特的測試也驗證了這一點——它在快速原型開發、幻燈片生成、創意寫作方面表現優異。目前千問 3.7 Max 限時五折,對於有 AI 輔助開發需求的讀者來說是一個不錯的選擇。
Q5:凱特對千問 3.7 Max 的整體評價如何?
凱特的總結是:千問 Max 模型進步非常明顯,編程能力令她驚喜。她非常期待 Max 模型早日加上視覺能力。她的實測建議是,在實際編碼中可以讓多個模型交互審查,即使強如 GPT-5.5,再加入千問 3.7 Max 來審查,也會有意外收穫。
主編隨筆
凱特這支評測影片最大的價值,在於它的測試設計有「交叉驗證」的思路——不是單純展示千問自己說自己多強,而是請 Gemini 和 GPT 來當第三方評審打分,這種做法在一般的 AI 評測影片中並不多見。
從測試結果來看,千問 3.7 Max 在編程方面的進步確實是亮點。我比較感興趣的是它十幾分鐘就能完成一個包含數據庫和後端邏輯的全端應用,這個速度在快速原型驗證的場景下非常有競爭力。當然 GPT 也指出了生產可用性的不足,這說明 AI 生成代碼目前仍處於「快速驗證」的階段,要上線還需要開發者做一輪品質把關。
另一個值得注意的點是凱特提到的多模型交互審查策略——讓千問寫完之後再請 GPT 審查,或者反過來。這個做法在實務上非常實用,因為不同模型在不同任務上有各自的強項,互相補充可以得到更好的結果。
結語
千問 3.7 Max 在凱特的全面測試中展現了紮實的進步,無論是小語種翻譯、創意寫作還是編程開發,都有令人滿意的表現。特別是十幾分鐘生成全端應用的能力,對於需要快速驗證產品概念的開發者來說,是一個值得關注的工具。
目前千問 3.7 Max 限時五折,有興趣的讀者可以趁這個機會體驗看看。凱特也預告了對 Max 模型加入視覺能力的期待,我們會繼續關注千問的後續發展。
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









