
NiceKate AI:Claude Sonnet 5 實測 — 圖像識別、3D建模、網頁生成等8個真實任務
NiceKate AI 實測 Claude Sonnet 5 最新模型,從圖像蟲子識別、3D模型生成、Figma網頁設計到路徑模擬,8項真實任務橫向對比 Gemini 3.1 Pro、GPT 5.5、Composer 2.5 等競爭模型。深入分析 Sonnet 5 的強項與致命缺陷。
開場閒聊
NiceKate AI 的主機在一開場就直接切入主題,介紹 Anthropic 最新發布的 Claude Sonnet 5(他稱之為 Sonnet 3.5 與 Sonnet 5,但從上下文來看指的是同一系列模型的最新版本)。他提到 Sonnet 5 官方號稱效能接近 Opus 4.8,但價格更低,而且到 8 月底前有價格促銷。
不過話鋒一轉,主機立刻點出一個關鍵陷阱:「Sonnet 5 用了更新的分詞器,token 花費大概增加 1.0 到 1.35 倍,所以促銷折扣下來也不一定便宜。」這種直言不諱的風格貫穿整支影片——不是單純的開箱吹捧,而是真實對比後給出優缺點分析。
懶人包速覽
| 核心痛點 | 解決方案 / 關鍵觀點 |
|---|---|
| AI 模型評測資訊繁雜,難以橫向對比 | Sonnet 5 在圖像辨識上超越 Gemini 3.1 Pro 與 GPT 5.5,成功識別出顯微鏡圖片中的 5 隻蟲子(Gemini 只找到 4 隻,GPT 5.5 沒找到) |
| 3D 模型生成品質參差不齊 | Sonnet 5 Max 模式可生成高品質 SCAD 模型,但耗時極長(10-20 分鐘),複雜度較低的任務用 Gemini 3.1 Pro 反而更快且效果更好 |
| Sonnet 5 思考時間太長、token 消耗大 | 即使在 High 模式下,思考過程大多為英文,且 token 消耗比前代增加 1.0-1.35 倍,整體使用成本不一定比 Opus 4.7 便宜 |
| 不同 AI 模型各有專長,難以選擇 | GPT 5.5 擅長多頁面 App 架構設計,Sonnet 5 Max 擅長精細圖像生成與渲染品質,Gemini 3.1 Pro 在特定任務(如手機支架生成)只需 2-3 分鐘即完成 |
這集的內容很適合正在評估哪個 AI 模型適合自己工作流程的開發者與設計師觀看。以下是我整理出的關鍵測試結果與個人補充分析。
Sonnet 5 圖像識別能力:顯微鏡下的蟲子偵測
主機首先測試 Sonnet 5 的圖像識別能力。他給出一張顯微鏡圖片,圖片中有幾隻蟲子在特定位置,要求模型找出所有蟲子並標註位置。
Sonnet 5 在 Crowd(測試平台)中選擇了 Max 模式,花費約 10 分鐘處理這個任務。它會將圖片放大到非常大,仔細檢查不同位置,然後用程式碼輔助辨識。最終它成功識別出 5 隻蟲子,並輸出局部放大版本和整圖標註版本,結果非常正確。
相比之下,主機用同樣圖片測試了其他模型:
- Gemini 3.1 Pro:只找到 4 隻蟲子(Gemini 一向被認為是圖像識別最強的模型)
- GPT 5.5 High:完全沒有檢測出來
在純圖像識別這個項目上,Sonnet 5 Max 模式表現出色,超越了業界公認的圖像識別王者 Gemini。
3D 模型生成:SCAD 格式的實戰表現
接著主機將同一張顯微鏡圖片餵給 Sonnet 5,要求生成 .SCAD 格式的 3D 模型(可在 OpenSCAD 中開啟,適合 3D 列印輸出)。Sonnet 5 再次花費非常久的時間,它會不停調用瀏覽器工具渲染結果、截圖檢視、再改進,反覆迭代。
最終生成的 3D 模型品質相當不錯。但作為對照,主機比較了:
- GPT 5.5 生成的版本:效果普通
- Composer 2.5 生成的版本:品質非常一般
Kurza 3D 設計:OPPO A5 摺疊手機支架
主機還讓 Sonnet 5 在 Kurza 裡面設計一個 OPPO A5 摺疊手機桌面多功能支架。Sonnet 5 處理了 20 多分鐘,過程中進行多角度截圖(任務結束後自動刪除)。然而最終結果有明顯缺陷——摺疊後手機站立的狀態下,手機離後面支撐板的距離太遠。
有趣的是,主機用 Gemini 3.1 Pro 測試同一個任務,只需 2-3 分鐘就生成了一個品質不錯的支架,雖然正面的透明部分有些編碼問題,但整體結構(防滑矽膠條、下方置物空間、充電口)都做得很好。主機直言:「這個任務 Gemini 3.1 Pro 完成的更好。」
蘇州博物館 Switch 場景:質感巔峰
這是影片中最令人驚豔的測試。主機讓 Sonnet 5 Max 製作一個蘇州博物館的 Switch 互動場景。模型處理了超過一個小時,過程中工具調用次數達到兩次,思考過程大多是英文。
但最終成果令人讚嘆:
- 地面材質設計非常到位
- 石頭小路的質感極佳
- 盆景的倒影效果真實
- 石片假山的質感是主機測試過的所有模型中最頂尖的
- 甚至會放大檢視松針貼圖在簡單光照下的渲染效果
主機評價:「它做的特別特別細,應該是我測試多個模型裡面這個質感做的是最好的了。」
完整 AI 菜譜 App 與耳機網站設計
主機還測試了 Sonnet 5 在 High 模式下的 UI 設計能力。
耳機網站:Sonnet 5 High 模式生成了一個風格類似蘋果的耳機產品頁,耳機耳罩的質感表現優異——主機強調之前多個模型對耳機造型的製作總是有些問題,但 Sonnet 5 表現得很好。
AI 菜譜 App(31 個頁面):主機先讓 GPT 5.5 決定 31 個頁面各自放什麼內容(他認為 GPT 5.5 在這種多頁面架構規劃上表現最好),再讓 Sonnet 5 實際生成。最終結果與 Opus 4.8 的版本差異不大。
十字路口交通模擬:車輛豐富但行人邏輯不佳
最後一個測試是讓 Sonnet 5 High 模式生成十字路口交通模擬。處理了 25 分鐘,過程中頻繁調用瀏覽器工具截圖。車輛模擬造型美觀,但紅綠燈擺放位置有問題,而且行人和車輛的互動關係一直處理不好。
此外主機也測試了 Sonnet 5 生成「千夫拉船」場景,如果從正面視角完全看不到千夫在哪裡,必須旋轉視角才看得到,而且千夫的身體姿勢也不夠合理——船在前進時千夫的身體應該向前傾斜,但模型沒有呈現這個細節。
QA 精選
Q1:Sonnet 5 適合哪些類型的任務?
Sonnet 5 Max 模式最適合需要精細圖像處理的任務,像是顯微鏡圖片中的目標物辨識、高品質 3D 場景生成(如蘇州博物館場景)。它在需要大量視覺迭代和細節檢查的任務上表現最好,但付出的時間成本也最高。
Q2:Sonnet 5 的最大缺點是什麼?
最大缺點是「思考時間過長」。即使在 High 模式下,思考過程也大多是英文,且耗時很長。加上新的分詞器讓 token 花費增加 1.0-1.35 倍,整體使用成本不見得比 Opus 4.7 便宜。主機的結論是:「一般任務真的不建議用 Sonnet 5。」
Q3:Sonnet 5 和 GPT 5.5、Gemini 3.1 Pro 相比如何?
三者各有專長。Sonnet 5 Max 在圖像識別和精細渲染上最強,GPT 5.5 在規劃多頁面 App 架構上表現最好,Gemini 3.1 Pro 則在某些 3D 生成任務上速度最快(2-3 分鐘完成 Sonnet 5 需要 20 分鐘的任務)。沒有單一模型在所有項目上領先。
Q4:Sonnet 5 的促銷價格值得現在入手嗎?
需要謹慎評估。雖然官方有 8 月底前的促銷優惠,但因為新分詞器會消耗更多 token,實際折扣幅度可能不如預期。主機建議針對自己的使用場景先測試再決定是否長期採用。
主編隨筆
這集 NiceKate AI 的實測最值得參考的地方在於——它不是單純的規格比較,而是用 8 個真實任務去驗證 Sonnet 5 的實際表現。圖像識別超越 Gemini 是個不小的亮點,但代價是極長的處理時間和更高的 token 消耗。
從實務角度來看,這再次驗證了一個趨勢:頂尖 AI 模型的「思考深度」正在快速增加,但這不代表它們適合所有場景。對於需要快速迭代的工作流程(如日常程式開發、快速原型設計),選擇輕量級模型反而更有效率。
另一個值得留意的點是 Sonnet 5 的分詞器變化。官方為了提升模型效能改用新分詞器,結果 token 消耗增加 1.0-1.35 倍——這對 API 成本有直接影響,尤其是需要大量對話的應用場景。這個 trade-off 使用者需要自己評估。
Sonnet 5 的定位更像是「終極問題解決者」——當其他模型都搞不定時,給它足夠的時間和 token,它很可能給出最好的答案。
結語
Sonnet 5 是一款讓人又愛又恨的模型:給它極大的 token 和時間讓它去迭代,生成效果確實優異——從蟲子識別到蘇州博物館場景,質感和準確度都是頂尖水準。但對於一般任務,它的思考時間和 token 消耗讓人卻步。
正如主機所說:「給它極大的 Token 之後,給它時間讓它去迭代,它的生成效果還是不錯的。」但這個「不錯」的代價,就看使用者願不願意買單了。
對於開發者來說,建議的策略是:日常開發和快速原型使用輕量級模型,只有在需要極致品質或複雜推理時才呼叫 Sonnet 5。用對工具,比用最強的工具更重要。
本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款。









