NiceKate AI觀看原文18 分鐘

NiceKate AI:實測 Grok 4.5 VS GPT 5.5 — 又好又快的新一代模型

Keda 實測 Grok 4.5 在編碼、多模態生成與工具調用上的真實表現,並與 GPT 5.5 Hi、Fable 5 Max 進行多輪對比。Grok 4.5 以極快的速度和相對親民的價格提供了接近旗艦模型的體驗。

開場閒聊

Keda 一開場就直接了當地宣布:「Grok 4.5 今天發布了!」語氣中帶點興奮,顯然對這款 xAI 新推出的旗艦模型期待已久。他將它定位為「又好又快的新一代模型」——這不是行銷話術,而是經過多項實測驗證後的結論。

他提到官方把 Grok 4.5 定位為能處理「困難長週期任務」的模型,不僅能創造性地使用工具解決問題,還能將複雜任務拆解成清晰步驟來執行。Keda 實測了 Grok 4.5 的多個面向,從清明上河圖生成到足球遊戲,從 3D 模型到應用程式開發,幾乎涵蓋了日常開發者的所有使用場景。

更驚人的是它的速度——Keda 在 GrokBuild 中推測它的吞吐量可能超過 80 TPS,比同級模型快上一個檔次。這個速度優勢在需要快速迭代的工作流程中尤其明顯,也是他認為 Grok 4.5 最值得推薦的原因之一。

「又好又快,而且價格相對 Opus 模型還是要便宜非常多。」這是他對 Grok 4.5 的最終評語。

懶人包速覽

核心痛點 關鍵觀點
Grok 4.5 的定價與定位 輸入 $2/百萬 token、輸出 $6/百萬 token,屬於中高階定價,但顯著低於 Opus 4.8 Max 和 Fable 5 Max。另有更快的 Fast 模式,價格略高。
與 GPT 5.5 Hi 的差距 在大部分任務上兩者表現接近,Grok 4.5 的 Markdown 閱讀器 App 初始完成度優於 GPT 5.5 Hi,但 Mac 應用的穩定性 GPT 5.5 更勝一籌。
與 Fable 5 Max 的差距 Fable 5 在創意生成(清明上河圖、足球遊戲)上完成度明顯更高,但價格也高出數倍。馬斯克本人也承認 Fable 比 Grok 4.5 好很多,但多數任務不需要 Fable 的能力。
適合誰用 適合需要快速迭代的開發者與創作者,特別是在編碼 Agent、前端生成、內容創作場景。對於追求頂尖品質的用戶,仍建議選 Fable 5 或 Opus 4.8。

今天的內容是 Keda 實測 Grok 4.5 的完整記錄,從價格定位到多項生成任務的實際表現,並且與 GPT 5.5 Hi 和 Fable 5 Max 進行了多輪對比。

主題段落

Grok 4.5 的基本定位與價格

Grok 4.5 是 xAI 和 Curve 聯合訓練的 MOE(Mixture of Experts)模型。與 Composer 2.5 是不同的權重量級,未來兩條產品線將各自獨立升級。

定價方面,Grok 4.5 的輸入價格為 $2/百萬 token,輸出為 $6/百萬 token,明顯低於 Sonic 5 和 Fable 5 Max。Keda 特別提到,目前在 GrokBuild 和 Curve 平台上還有免費使用額度,對開發者來說是個低成本試水的機會。

上下文視窗約 500K token,馬斯克表示很快會提升到 1M。這對於處理大型代碼庫或長篇文件的分析場景來說相當實用。

實測一:清明上河圖生成

Keda 使用 GrokBuild CLI 的預設推理模式進行了一系列實測。第一個任務是生成互動式的清明上河圖 3D 場景。

Grok 4.5 在 3-4 分鐘內完成了整個頁面。Keda 指出畫面中存在一些問題:橋上的人物有躺著被踩的情況、橋下船隻的行進方向不正確、河邊的店鋪資訊沒有完整呈現。不過整體來看,橋面結構和兩旁的房子還算可以接受。

接著他讓 GPT 5.5 Hi 模式生成同樣的場景。結果顯示 GPT 5.5 在房屋招牌上做出了細節,但招牌風格與古代常見樣式差異很大,河水的渲染也有明顯問題(水面和陸地交替出現)。

Fable 5 Max 則是在這個任務上表現最好的模型——水面質感、招牌搖晃感、行人的陰影、屋頂的細節都做得非常到位。Keda 總結:「毫無疑問,Fable 5 在這裡完成度是最好的。」

實測二:足球遊戲

第二個實測是製作一個可互動的足球遊戲。Grok 4.5 生成的版本包含場地、球員(5 綠 vs 5 紅)、觀眾和擊鼓的人,玩家可以透過 W/S/A/D 操作角色、J/Q 進行傳球和射門。不過 Keda 發現場地中間放置了一些奇怪的木棍,紅隊球員也幾乎不太移動。

Fable 5 Max 的版本明顯更完整——它有音效(擊球和傳球有不同節奏)、更積極的紅隊球員、進球動畫、場地腳印痕跡,還有不同模式可切換。

GPT 5.5 Hi 則在畫面下方加入了即時解說功能,這是一個很有創意的亮點。Keda 認為 GPT 5.5 在這個任務上與 Grok 4.5 表現接近。

實測三:3D 模組與生成應用

在 3D 耳機網頁的生成任務中,Grok 4.5 的初始版本有些結構上的問題,但當 Keda 提供參考圖片要求「百分百復刻」時,它成功產生了包含粒子效果的進度條等細節。

3D 模組生成方面,Keda 讓多個模型選擇不同預設造型來測試,Grok 4.5 在 2-3 分鐘內完成,效果讓他相當滿意。相比之下,有些模型可能需要花費 10 分鐘才能達到類似的效果。

在看手錶 SCD 文件生成上,Grok 4.5 表現也不錯——表面花紋處理細緻,但整體不夠乾淨,機械結構的擺放位置與原圖有偏差,表帶的縫線細節也沒有完美還原。

實測四:應用程式開發

Grok 4.5 在開發 Markdown 閱讀器 Android 應用時表現優於 GPT 5.5 Hi。Keda 發現 GPT 5.5 生成的應用有兩個問題:表格會隨手指滑動忽大忽小,以及上方文件名與下方文字在滾動時發生重合。Grok 4.5 沒有遇到這兩個問題。

不過在 Mac 應用(影片加水印)的開發上,Grok 4.5 的穩定性就輸給了 GPT 5.5。它一開始構建時出現多次應用崩潰,雖然逐一修復了,但後來又發生了導出問題、圖像 180 度翻轉等狀況。Keda 總結:「在這個 Mac 應用的開發上,還是 GPT 5.5 更穩。」

實測五:影片生成與工具調用

最後,Keda 讓 Grok 4.5 生成一段影片。他直接將 Hyperframes 的倉儲連結和 Grok 4.5 的介紹頁面丟給模型,讓它自行處理。

有趣的是,Grok 4.5 主動使用 AI 合成的音頻,而不是調用 Hyperframes 內建的音頻資源,顯示出它在工具選擇上具備一定的自主判斷能力。在 Keda 要求改用 Minimalist 相關 skill 後,它成功生成了中文、明亮色調的介紹影片。

「比我想像中還是要好一點。」Keda 這麼說。

QA 精選

Q1:Grok 4.5 和 GPT 5.5 Hi 到底哪個比較強?

從 Keda 的多輪實測來看,兩者互有勝負。在 Markdown 閱讀器 App 的開發上,Grok 4.5 的初始完成度明顯更好(沒有表格縮放問題、沒有文字重疊)。但在 Mac 應用的穩定性上,GPT 5.5 Hi 更可靠,Grok 4.5 在迭代過程中出現了多次崩潰和導出問題。整體而言,兩者的能力大致在同一水平線,選擇哪個取決於具體任務的需求。

Q2:Grok 4.5 的價格真的有競爭力嗎?

Grok 4.5 的輸入 $2/百萬 token、輸出 $6/百萬 token 的定價,在目前市場上確實有競爭力。與 Fable 5 Max 相比便宜了數倍,也比 Opus 4.8 Max 實惠。Keda 特別提到一個關鍵數據:Grok 4.5 的 token 效率非常高——相對於 Opus 4.8 Max,它在完成相同任務時使用的 token 數更少,這意味著實際使用成本會比帳面價格差距更大。

Q3:Grok 4.5 的編碼能力在什麼水平?

根據 AA 排行榜單和 Keda 的實測,Grok 4.5 的編碼 Agent 能力僅次於 Fable 5 和 GPT 5.5。在代碼審計任務中,它能夠快速完成並產出基本正確的結果。Keda 特別推薦了一個使用技巧:在提示詞末尾加上引導語,讓 Grok 並行啟動多個子代理來分工解決問題,這在處理複雜編碼任務時非常有幫助。

Q4:Fable 5 比 Grok 4.5 好在哪裡?值得多花錢嗎?

馬斯克本人也承認 Fable 5 Max 比 Grok 4.5 好非常多,這一點在 Keda 的實測中也得到了驗證。

Fable 5 在清明上河圖、足球遊戲等創意生成任務上的完成度明顯更高,細節更豐富,甚至還有音效設計和動畫效果。Keda 特別指出 Fable 5 在「清明上河圖」的水面質感、屋頂細節、行人陰影方面都做得非常到位,三款模型中只有 Fable 5 能做出令人滿意的效果。

但馬斯克也認為多數任務並不需要 Fable 的能力。Keda 的觀點很務實:如果只是日常開發、原型驗證或內容創作,Grok 4.5 的速度和價格優勢讓它成為更實際的選擇;只有在追求頂尖品質的場景下,才值得升級到 Fable 5。

Q5:Grok 4.5 有哪些獨特優勢?

Grok 4.5 最大的獨特優勢是與 X(Twitter)生態系統的深度整合。它能夠直接獲取 X 的數據,無需額外工具就能進行社交媒體分析。Keda 展示了一個實例:Grok 4.5 透過 CDP 的 MCP 協議自行截取 X 上的截圖,自動完成資訊收集。此外它的速度優勢也很明顯——大部分生成任務在 2-4 分鐘內完成,而同級模型可能需要 10 分鐘以上。

主編隨筆

Grok 4.5 的發布讓 AI 模型市場多了一個值得關注的選擇。Keda 的實測方法很紮實,不是只看跑分,而是從實際任務角度來驗證能力——從生成藝術到應用開發,這種全方位的測試方式對我來說非常有參考價值。

我認為 Grok 4.5 最大的亮點其實不在於它有多強,而在於它的「速度 vs 品質」取捨做得很好。市場上已經有不少頂尖模型,但它們要麼貴、要麼慢、要麼兩者兼具。Grok 4.5 選擇了一條不同路線:用 MOE 架構換取速度,用相對實惠的價格換取用戶規模。從 xAI 公開的定價策略來看,他們顯然是想搶佔開發者這個核心族群——開發者對迭代速度最敏感,也最願意在一個工具生態系中長期投入。

不過需要注意的是,Grok 4.5 在複雜的創意任務和長時間運行的穩定性上,與頂尖模型仍有明顯差距。如果你主要的工作是生成高品質的視覺內容或構建複雜的 Mac/桌面應用,目前的版本可能還不是首選。但對於日常的編碼輔助、前端原型、數據分析這類任務,它的速度優勢可以明顯提升工作效率。

最後說一個觀察:xAI 正在快速迭代,從 Grok 4.2 到 4.5 的進步幅度相當大,而且上下文的 1M 擴展也在路上。這個模型家族的潛力可能還遠遠沒有完全釋放。

結語

Grok 4.5 是一款定位精準的模型——它不是最強的,但它在速度、價格與能力之間找到了很好的平衡點。對於開發者、創作者和研究人員來說,它提供了一個非常實用的日常工具選擇。

Keda 的實測讓我們看到,Grok 4.5 已經能夠勝任編碼 Agent、前端生成、應用開發和內容創作等多種場景,在某些任務上甚至與 GPT 5.5 Hi 不相上下。隨著 xAI 持續升級上下文至 1M 並優化 Composer 產品線,Grok 系列未來的表現值得持續關注。

如果你還沒有試過 Grok 4.5,可以透過 GrokBuild 或 Curve 平台免費體驗。正如 Keda 所說:「又好又快,而且價格相對親民。」

本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款