NiceKate AI觀看原文8 分鐘

NiceKate AI:小米 MiMo V2.5 Pro 实测:惊喜和不足

K 实测了小米最新发布的 MiMo V2.5 Pro 模型,在十字路口交通仿真、3D 场景生成、复古相机模拟等多项任务中展现了惊喜的编码能力,但也暴露了输出中断、预览失效等稳定性问题。与 Opus 4.7 和 K 2.6 的对比评测,值得 AI 开发者参考。

開場閒聊

K 一開場就說,小米在凌晨發布了 MiMo V2.5 和 V2.5 Pro 兩款模型,都支援 100 萬 token 上下文長度。這次的「V2.5 Pro 实测」涵蓋了從交通模擬到 3D 場景的多項任務。

她特別強調這次小米很有信心地把 V2.5 Pro 拿來跟 Opus 4.6 和 GPT 5.4 放在一起比較,博文裡的 Zero-shot 編譯器和全功能視頻模擬器案例做得相當出色,甚至讓她忍不住喊出「真的希望他們能開源」。

不過她話鋒一轉,笑著說這次的 V2.5 Pro 實測過程中遇到了不少「小意外」——模型在生成到一半突然中斷是家常便飯,有時候還得跟 AI 說「繼續」才能把結果生完。

懶人包速覽

核心痛點 K 的實測發現
MiMo V2.5 Pro 的編碼實力在哪個層級? 十字路口交通仿真非常出色,3D 夢幻場景的花卉效果略遜 Opus 4.7,但蝴蝶動畫表現更優
長時間任務的穩定性如何? 多次遇到輸出中斷(700-900 秒思考後中斷),需要手動要求繼續才能完整輸出
多模態 V2.5 的圖片識別能力? 圖片還原測試結果「相距甚遠」,遠不如 K 2.6,推測是圖像識別或編碼能力較弱
這款模型值得使用嗎? 編碼能力有驚喜,尤其前端模擬類任務表現優異,但穩定性仍需改善

我花了大概 15 分鐘看完 K 的 V2.5 Pro 實測過程,內容從交通模擬一路測到復古相機、3D 場景、磨尺模擬、提壺騎腳踏車——題材非常多元。這篇文章幫大家整理出 MiMo V2.5 Pro 在 6 個核心測試中的表現,以及我從開發者角度的評價。

十字路口交通仿真:最好的驚喜

K 讓 MiMo V2.5 Pro 做了一個十字路口交通模擬,模型思考了 11 分鐘後生成結果。

她特別讚賞的是,MiMo 很聰明地在每個交通燈上方標示了對應的燈號顏色——這個細節是許多其他模型忽略的。而且不像某些模型把車子簡化成一個長方體,小米的車子有頂棚、有造型,整體視覺效果相當不錯。

K 還發現可以在下方調整運行速度和東西流向,整個頁面沒有報錯,穩定性表現很好。

禮物包裝智能助手:設計感佳但有細節缺漏

這個測試中,MiMo 生成了一個禮物包裝智能助手界面。K 認為包裝紙圖案非常接近現實生活中的樣式,配色方案也選得很到位。左側的紙張展開圖和右側的預覽對比排版她也覺得不錯。

不過她也指出了一個問題:包裝的絲帶(繩子)在左邊預覽中缺失了一部分,正常來說每個面都應該有絲帶裝飾。此外,禮品卡片雖然做了好幾個樣式,但用了 emoji 當裝飾稍嫌不夠時尚。

K 補充說,最近她也測試過其他國產模型,有的包裝會有突出變形,有的則是外包裝和盒子有較大分離——在這方面 MiMo V2.5 Pro 的表現還是相對可靠的。

復古膠片相機模擬器:邏輯設計巧妙

K 讓 MiMo 做了一個復古膠片相機模擬器。她特別提到一個值得稱讚的設計邏輯:當她從電腦上傳一張圖片後,畫面並沒有立即顯示圖片,而是要點擊一下「拍攝」按鈕才出現。

她說「我覺得 MiMo 在這裡做的非常好」,因為其他模型(包括 Opus 4.7 和 K 2.6)都是上傳後立即顯示圖片,而 MiMo 反而更接近真實相機的操作流程。

不過這個設計也帶來了問題:假設預覽圖沒有顯示出來,那麼用戶調整漏光、劃痕、暗角、顆粒等參數時,預覽畫面不會同步更新——必須再點擊一次拍攝才能看到效果。而且調整過的劃痕樣式,在再次拍攝前也不會顯示在預覽中。

夢幻 3D 場景:蝴蝶比 Opus 4.7 更出色

K 讓 MiMo 生成一個非常夢幻的 3D 花園場景——這是她最近也讓 Opus 4.7 做過的對比測試。MiMo 的表現相當不錯,當滑鼠點擊畫面某處時,該處的花朵會有突出和光亮效果,這個互動反饋比 Opus 4.7 更好。但整體畫面的花朵真實度不如 Opus 4.7。

另一方面,蝴蝶的表現 MiMo 完勝:蝴蝶展翅飛翔的動畫和數量控制都很到位。使用者可以調整色系、增加蝴蝶數量,風力也可以調整。

不過 K 提到,模型在一次提示後花了 700 多秒思考,在輸出過程中再次出現中斷,需要提示繼續——這是她反覆遇到的穩定性問題。

3D 磨尺模擬與提壺騎車:多段生成的挑戰

磨尺測試中,MiMo 思考了 15 分鐘,輸出時再次中斷。K 讓它繼續後,畫面缺少磨尺,又得再修改一次。最終磨尺出現了(可以切換 24 節和 36 節),也可以選擇不同顏色和關節角度。但切換到預設的球形或小狗造型時,效果不盡理想。

提壺騎自行車的測試更突顯了 MiMo 的一個問題:K 希望生成單一頁面,但 MiMo 將內容分成了多個代碼片段。更糟的是使用 MiMo AI Studio 時,頁面在生成過程中突然顯示「未登錄」狀態——K 說「網頁上現在還是有一些 bug」。

最後的牽夫拉船場景,水面效果非常不錯,但繩子和牽夫身體之間有明顯距離感,牽夫的腿和上半身也有連接問題。

V2.5 多模態測試:圖片還原能力明顯不足

K 也簡單測試了 V2.5(非 Pro)的圖片識別能力。她給了一張參考圖片要求還原,MiMo V2.5 思考 82 秒後生成的結果與原圖「相距甚遠」。

她對比了之前 K 2.6 做的還原效果,認為 V2.5 不論是圖像識別能力還是編碼能力都明顯偏弱。她也補充說,V2.5 雖然支援音頻理解,但視覺理解這塊顯然還有很大的進步空間。

小米 MiMo V2.5 Pro 與其他國產模型的對比

除了 MiMo,K 也在影片中提到了近期測試的其他國產模型。她觀察到一個有趣的現象:每個國產模型都有自己的強項和弱點。

有些在包裝設計上會出現突出變形,有些則是在外殼分離程度上表現不好。相比之下,MiMo V2.5 Pro 在包裝結構的連貫性上表現最好,這也是她認為「相對可靠」的原因之一。

在編碼任務的多樣性上,MiMo 涵蓋了交通模擬、3D 場景、相機模擬等不同類型——比許多只擅長單一領域的國產模型更全面。

QA 精選

Q1:MiMo V2.5 Pro 的編碼能力跟 Opus 4.7 比起來如何?

從 K 的實測來看,兩者各有勝場。MiMo 在蝴蝶動畫和花朵互動反饋上勝過 Opus 4.7,但花朵的真實度不如 Opus 4.7。

在前端模擬任務(十字路口交通、復古相機)上 MiMo 表現出色,設計邏輯甚至比主流模型更貼近真實使用場景——比如上傳圖片後要點擊拍攝才顯示照片的設計。

不過 MiMo 在長時間任務的穩定性上明顯弱於 Opus 4.7,多次輸出中斷需要手動恢復。Opus 4.7 在同樣的 3D 場景任務上沒有出現中斷問題。

Q2:MiMo V2.5 Pro 支援圖片識別嗎?跟 V2.5 有什麼不同?

K 明確指出 V2.5 Pro 沒有視覺能力,而 V2.5 支援音頻理解和圖片識別。

但從實測結果來看,V2.5 的圖片還原能力很不理想——K 用一張參考圖要求還原,V2.5 思考 82 秒後的結果與原圖差異很大,遠不如 K 2.6 的表現。

所以如果需要多模態功能,目前還是要選擇 V2.5(非 Pro)版本,但要接受其圖像能力仍有進步空間。

Q3:MiMo 的輸出中斷問題有多嚴重?會影響日常使用嗎?

K 在多次測試中都遇到了這個問題:模型思考 700-900 秒(約 11-15 分鐘)後,輸出突然中斷,需要手動提示「繼續」才能完成。

她在十字路口模擬、3D 場景、磨尺等多項任務中都遇到同樣情況。更令人困擾的是,MiMo AI Studio 在生成過程中還出現過突然跳出「未登錄」狀態的 bug。

對日常使用來說,這代表需要有人在旁監控生成過程,無法完全放手自動化。這也是 MiMo 目前跟一線模型最關鍵的差距之一。

Q4:目前有哪些方式可以使用 MiMo V2.5 Pro?

K 分享了三種使用方式:OpenCode(Go 版本)、小米官方的 Token Plan、以及小米官方 API。

她也讓 AI 幫她整理了三者的差異,建議使用者根據自己的需求和預算來選擇。

對開發者來說,OpenCode 是最快上手的途徑,而官方 API 則提供更穩定的服務品質。Token Plan 則適合需要大量 API 調用的大規模使用者。

Q5:中國國產 AI 模型跟國際一線模型的差距現在還有多大?

從 K 的測試來看,MiMo V2.5 Pro 在特定任務(交通模擬、前端互動設計)上已經達到甚至超越 Opus 4.7 的水準。

但在長時間生成的穩定性和多模態理解上仍有明顯差距。K 提到她測試的其他國產模型也各有優缺——有的包裝設計變形、有的外殼分離嚴重。

整體來說,中國國產模型在單一任務的編碼品質上進步顯著,但要達到像 Opus 或 GPT 系列那樣的全面穩定性,還需要一段時間。

不過像 MiMo 這樣在前端設計細節上展現「產品思維」的模型,確實讓人對中國 AI 的未來感到期待。

主編隨筆

K 在這次實測中做了一個我很欣賞的動作:她不只測試了 MiMo 的強項(交通模擬、3D 場景),還刻意去挑戰它的弱點(圖片還原、長時間生成穩定性)。

這種「不挑題」的測試方法,其實比官方 Benchmarks 更有參考價值——因為使用者日常遇到的問題,往往不是模型擅長的題目。

從我的角度來看,MiMo V2.5 Pro 最讓我驚豔的不是它某個測試結果特別好,而是它在前端模擬類任務上的「設計 sense」。

比如交通燈上方自動標示燈號顏色、復古相機點擊拍攝才顯示照片的真實感。這些細節不是靠參數量堆出來的,而是模型對真實世界操作流程的理解。這點讓我對小米 AI 團隊的產品思維刮目相看。

但穩定性問題確實是硬傷。一個思考 15 分鐘後輸出中斷的模型,在生產環境中幾乎無法使用——你不可能每次都守在電腦前按「繼續」。

好消息是,這類問題通常可以透過微調和後處理來改善,而且 MiMo 系列才剛發布,後續迭代值得期待。

結語

小米 MiMo V2.5 Pro 是一款「驚喜與遺憾並存」的模型。它在單一編碼任務上的表現讓人眼睛一亮——交通模擬、復古相機設計、3D 蝴蝶動畫,都展現了小米 AI 團隊對產品細節的重視。

但輸出中斷、預覽不同步、圖片識別偏弱等問題,說明了距離成熟的生產級模型還有一段路要走。

對於 AI 開發者來說,MiMo V2.5 Pro 值得花時間實測——尤其是前端模擬和互動設計相關的團隊。但如果你需要的是穩定可靠的長時間任務執行,目前仍是 Opus 或 GPT 系列更適合。K 的這次評測非常全面,推薦有興趣的 AI 開發者觀看完整影片。

本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款