
NiceKate AI:GLM-5.1 真實體驗 — SWE-Bench Pro 很強,實戰表現如何?
NiceKate AI 實測智譜 AI 開源的 GLM-5.1,在 Joy 平台上從 PDF 生成、PPT 製作、3D 空間建構一路測到交通仿真與影片製作,全面檢驗這款 SWE-Bench Pro 高分模型的真實能力。
開場閒聊
NiceKate AI 一開場就直言,GLM-5.1 最近正式開源了。官方數據顯示 SWE-Bench Pro 很強,得分非常亮眼,在編碼方面的能力備受期待。她之前因為沒有 Coding Plan,一直沒有機會親自體驗,直到最近發現 Factory 宣布 GLM-5.1 已經在 Joy 平台上線,才終於有機會一探究竟。
她提到 Joy 平台有些用戶認為它比 Cursor 更好用,因此這集的測試從頭到尾都在 Joy 上進行。這也讓觀眾有機會了解,如果沒有昂貴的 Coding Plan,是不是還是可以透過 Joy 來體驗 GLM-5.1 真實體驗的全貌。
懶人包速覽
| 核心痛點 | 解決方案 / 關鍵觀點 |
|---|---|
| GLM-5.1 開源後實際體驗如何? | 在 Joy 平台上測試,整體表現流暢,幾乎沒有報錯 |
| PDF 生成品質夠專業嗎? | 基礎功能可用,但中文字體處理有亂碼,需額外提示修正 |
| 能不能做出有設計感的 PPT? | 還原設計文檔風格的能力很強,但部分細節(頁角形狀)不一致 |
| 3D 場景與影片製作能力如何? | 能生成 Piranesi 風格 3D 空間,並自動製作 Remotion 影片與配樂 |
GLM-5.1 在 SWE-Bench Pro 上拿下高分,很多人問:SWE-Bench Pro 很強,實戰表現如何?這篇文章帶你一探究竟。
PDF 生成:基礎可用,中文字體有小問題
NiceKate AI 首先讓 GLM-5.1 透過 MiniMax 的 PDF Skill 來生成一份高品質 PDF。MiniMax 開源了 PDF、PPT、DOC 相關的 Skills,她認為非常好用,推薦大家嘗試。
GLM-5.1 很快就產出了第一版 PDF,但問題出現了——生成的文檔中有不少亂碼,沒有正確處理中文字體。於是她又補了一次提示,要求使用中文字體。修改後的版本明顯改善,封面採用暗色設計,視覺上相當有質感。
不過她也發現文字排版有些小瑕疵,整體來說 PDF 生成功能是堪用的,但需要使用者多一層提示來確保品質。
PPT 製作:設計風格還原度令人驚艷
接下來是最受關注的測試——PPT 生成。NiceKate AI 讓 GLM-5.1 製作高品質簡報,並授權它使用 PPT 相關的 Skill。
Joy 平台的特色在於它會自動並行使用子代理來製作所有幻燈片,NiceKate AI 可以透過 Joy 的介面看到不同的子代理各自在做什麼、進展如何。她發現第一版生成的幻燈片規畫中,左邊標題是英文、右邊內容是中文,整體呈現全英文風格。
於是她要求換成中文,並提供了一份她在 Google Stitch 影片中介紹過的設計文檔,直接讓 GLM-5.1 參考這個設計風格重新設計 PPT。
結果令人印象深刻——還原後的風格與提供的設計文檔非常一致,從版面配置到色調都忠實複製。基準指標頁呈現得不錯,向量資料庫優化與 GPU 核心優化等技術內容也有清楚的圖表呈現。不過 NiceKate AI 也注意到了細微的不一致,例如頁角在第 11 頁是橢圓形,但在第 9 頁卻變成了長方形設計,這反映了並行代理處理時可能出現的風格漂移。
3D 空間與資訊卡:一個指令從零建構
NiceKate AI 接著對 GLM-5.1 提出了更具挑戰性的需求——製作一個受 Piranesi 啟發的 3D 空間。Piranesi 是 18 世紀著名的版畫家,以不可能的階梯、巨大的石柱和複雜的建築結構聞名。
GLM-5.1 第一版生成的 3D 空間畫面非常暗,於是 NiceKate AI 要求改為明亮的風格,並在生成後詢問它是否有調用相關的 Skill。GLM-5.1 誠實回答沒有。
優化後的版本有了明顯改善——六座拱門、四方向走廊、無線拱頂與巨型石柱,每個細節都呈現出 Piranesi 版畫的經典元素。放大後可以看到不同的階梯設計,整體非常有質感。
更進一步,NiceKate AI 讓 GLM-5.1 調用喬木開源的資訊卡 Skill,將這個 3D 應用做成 16:9 的資訊卡,並要求它自己截取應用的不同角度圖來做介紹。GLM-5.1 完成的三頁資訊卡中,右側的截圖都是它自己獲取並排版的,品質相當專業。
影片製作與交通仿真:多工能力的極致考驗
Remotion 影片自動生成
資訊卡完成後,NiceKate AI 繼續加碼——要求 GLM-5.1 使用 Remotion 製作介紹 3D 場景的影片。GLM-5.1 很快完成,從一開始的標題頁到第二頁的漸進動畫,整體風格與資訊卡高度一致,展現出跨媒介的一致性。
交通仿真與 Playwright 驗證
更令人驚訝的是,NiceKate AI 要求 GLM-5.1 做一個十字路口的交通仿真。GLM-5.1 完成後附上總結說有做「驗證」。NiceKate AI 追問它是如何驗證的,GLM-5.1 回答它用了 Playwright 自動化瀏覽器做了三項基礎認證——這個自主驗證的能力顯示 GLM-5.1 具備一定程度的 Agent 自主性。
當被問及是否調用了 Skill 來做驗證時,GLM-5.1 表示它調用了 Web-app-testing Skill(由 Ansys-Opit 開源),這是之前已經安裝在電腦上的。
自動錄製示範影片
最後一個驚喜是 GLM-5.1 能為自己生成的應用自動錄製示範影片。NiceKate AI 讓它自己去錄製,最終的影片展示了豐富的角度切換與功能演示,錄製效果比手動展示還要好。
更令人驚豔的是,影片中的配樂也是 GLM-5.1 自己生成的——它成功調用了 Music Skill,一次提示就完成。NiceKate AI 特別提到,Piranesi 3D 空間的背景音樂風格(暗黑氛圍館、風景)選擇得非常到位。
QA 精選
Q1:GLM-5.1 在 PDF 和 PPT 生成上的最大問題是什麼?
中文字體處理是主要痛點。第一次 PDF 生成時出現大量亂碼,需要額外提示「使用中文字體」才能修正。
PPT 方面,雖然風格還原度很高,但並行代理處理導致的細節不一致是需要注意的方向。例如頁角形狀不統一,在第 11 頁是橢圓形,第 9 頁卻變成了長方形。
NiceKate AI 認為這些問題可以透過改進 Skill 或提示詞來解決,並非 GLM-5.1 本身的能力限制。
Q2:GLM-5.1 與 Kimi 在影片生成上誰比較強?
NiceKate AI 做了一個直接的對比測試,讓兩者分別製作色彩理論的演示影片。
結果顯示,在這個任務上 Kimi 完成得更好,質量和細節更勝一籌。
但 GLM-5.1 在自主錄製示範影片和自動配樂方面表現出色,各有千秋。兩者的定位不同,GLM-5.1 的強項在於任務鏈執行,而非單一任務的品質。
Q3:GLM-5.1 的自主驗證能力是真的假的?
是真實的。在交通仿真任務中,GLM-5.1 主動提到做了驗證,被追問後誠實回答使用了 Playwright 自動化瀏覽器進行了三項基礎認證。
它還明確指出調用了 Web-app-testing Skill。這種「做完任務後自行驗證」的行為模式,展現了 GLM-5.1 具備初階的 Agent 自主性,不是單純的對話生成或模板化輸出。
Q4:沒有 Coding Plan 的使用者能用 GLM-5.1 嗎?
可以。NiceKate AI 自己就是因為沒有 Coding Plan 而一直沒機會體驗。
GLM-5.1 後來在 Joy 平台上線,只要註冊 Joy 帳號就可以使用。Joy 平台的並行子代理架構讓任務執行更有效率,使用者可以直觀看到各個子代理的進度。
這也降低了 GLM-5.1 的使用門檻,讓更多開發者可以在不購買付費方案的狀況下體驗這款模型。
Q5:GLM-5.1 整體表現如何?值不值得推薦?
NiceKate AI 的整體評價是非常正面——最大的亮點是幾乎沒有報錯,流程順暢。
從 PDF、PPT、3D 空間到影片錄製與配樂,整個任務鏈一氣呵成。她認為 GLM-5.1 在自主編寫 Provider 腳本、調用各種 Skill 的能力上都相當順暢。
雖然 PDF 和 PPT 有小問題,但這些是可以後續優化的方向。整體而言,對於想嘗試開源編碼模型的開發者來說,GLM-5.1 是一個非常值得一試的選擇。
Q6:GLM-5.1 的背景音樂生成是怎麼做到的?
GLM-5.1 成功調用了 Music Skill,NiceKate AI 只給了一次提示就完成了 Piranesi 3D 空間的背景音樂。
GLM-5.1 自動選擇了「暗黑氛圍館、風景」的音樂風格,與 Piranesi 版畫的古典氛圍非常契合。
她認為這個音樂選擇的品味相當到位,顯示 GLM-5.1 不僅能調用工具,還能理解內容的調性並做出符合語境的風格判斷。
主編隨筆
GLM-5.1 這款模型的亮點不在於單一任務上的絕對優勢,而在於它展現了「任務鏈」的連貫執行能力。從一個簡單的指令開始,它能夠自主調用 PDF Skill、PPT Skill、資訊卡 Skill、Music Skill,甚至主動用 Playwright 驗證自己的輸出——這種「做完還會檢查」的行為在開源模型中並不多見。
不過我觀察到一個有趣的現象:NiceKate AI 的測試方式本質上是「給一個目標,讓模型自己規劃路徑」,而不是「一步步下達指令」。這種開放式的測試對模型的 Agent 能力要求更高,GLM-5.1 能順利完成已經說明了它的基礎架構設計相當成熟。
如果以我的標準來看,GLM-5.1 目前最大的缺口不在於能力本身,而在於輸出的穩定性和一致性——同樣的任務給同樣的提示,能否每次都產出一樣的品質?從 PPT 頁角形狀不一致的例子來看,這方面還有進步空間。但對於一個剛開源的模型來說,這個起點已經非常高。
結語
GLM-5.1 證明了智譜 AI 在開源模型領域的實力。從 SWE-Bench Pro 的理論高分到真實世界的多工測試,它展現了令人印象深刻的 Agent 自主性與跨任務協作能力。雖然在 PDF 中文字體、PPT 細節一致性上還有改善空間,但整體流暢度和幾乎零報錯的表現,讓它成為 2026 年上半年最值得關注的中文開源模型之一。
NiceKate AI 在影片最後也提到,她希望這些測試能幫助觀眾了解 GLM-5.1 的真實能力,我們也可以期待後續的 Skill 和提示詞優化能進一步釋放這款模型的潛力。
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









