NiceKate AI觀看原文

NiceKate AI:GPT-5.5 實測全流程 — 編碼、研究、PPT、App 生成深度評測

Kate 實際測試 GPT-5.5 在編碼、研究、PPT、App 生成等場景的表現,從透明水族箱桌面應用到動畫影片製作,全面評測 5.5 的強項與短板。

開場閒聊

Kate 一開場就直說:「GPT-5.5 正式發布了,我體驗了這個小時,發現非常不錯。」她提到 5.5 在編寫調試代碼、在線研究、數據分析、創建文檔和表格、操作軟件、跨工具協作等領域表現出色。

這是一篇 GPT-5.5 實測全流程的深度評測,從編碼到 App 生成深度評測,完整覆蓋 Kate 的實測體驗。關於 5 實測全流程的部分,Kate 從規格介紹一路實測到多個應用場景,內容非常扎實。關於 App 生成深度評測,她在 Android App 和理髮網頁的實測特別有參考價值。

速度上 5.5 和 5.4 差不多,但智力能力更高。API 價格輸入 5 美元、輸出 30 美元,比 Opus 4.7 還要貴。好在 Sam Altman 也說了,因為智力能力提高,每個任務所需的 token 數量確實比 5.4 更少。即將開放的 API 上下文長度最長可達 100 萬 token。

懶人包速覽

核心痛點 解決方案 / 關鍵觀點
GPT-5.5 價格較高,值得升級嗎? 編碼能力跨越式進步,日常工作效率大幅提升,但計劃能力仍遜於 Opus 4.7
編碼工具選擇太多,哪個最強? 快速原型開發 5.5 勝出,複雜計劃性專案建議 Opus 4.7 做計劃 + 5.5 執行
AI 生成應用總是只有外表沒有功能? 提示詞要非常明確指定功能而非模擬,否則 AI 容易偷懶只做表面
從圖片生成應用的流程可靠嗎? 可行但需多次迭代,且 AI 常不重新調用圖片生成工具而是重用舊圖

我花了完整時間看完 Kate 對 GPT-5.5 的深度實測,從桌面應用到動畫影片,資訊量非常大。這篇文章幫你整理出 5.5 在各個場景的真實表現,以及我個人對它能力邊界的判斷。

GPT-5.5 規格速覽:價格與定位

GPT-5.5 的 API 定價(輸入 5 美元、輸出 30 美元)比 Opus 4.7 更高,但官方強調智力提升後每個任務的 token 用量更少,整體成本未必更高。

在 Benchmark 表現上,5.5 在 ARC-AGI-2 榜單得分相當高。不過有位提前使用的博主做了詳細對比,認為 5.5 的計劃質量仍然遜於 Opus 4.7,最好的策略是讓 Opus 4.7 做計劃、5.5 去執行。

在前端和全棧產品開發上,5.5 也仍然不如 Opus。Plus 和 Pro 用戶從發布日起即可使用 GPT-5.5 Thinking。在 Codex 中使用快速模式的成本也會更高。

編碼能力實測:透明水族箱桌面應用

Kate 首先讓 GPT-5.5 生成一個 MacOS 桌面透明水族箱應用。這個任務 5.5 只花了 9 分鐘就完成,速度相當驚人。

Kate 提到之前用其他 AI 編程工具做過類似任務,但都因為構建速度慢或錯誤太多而沒有呈現在影片中。

完成的功能包括:透明無邊框浮動視窗、運行時背景不干擾打字、鼠標點擊畫面可調出魚食、魚會游過來吃食。Kate 接著讓 5.5 檢查性能問題,它發現了瓶頸並將默認幀率降到 30 FPS。最後 Kate 讓它生成應用圖標,效果雖然不算特別滿意,但整個流程十幾分鐘就全部搞定。

這個實測清楚展示了 5.5 在快速原型開發上的驚人效率——從零到完整可用的桌面應用,全部在一杯咖啡的時間內完成。

圖片轉應用:從 Android App 到理髮網頁

Kate 拿之前用 GPT Image 2 生成的圖片,讓 5.5 根據圖片製作 Android 應用。5.5 處理了 42 分鐘後成功安裝到手機上,畫面看起來有模有樣——首頁、記錄、收藏、我的等分頁一應俱全。

但問題來了:點擊更細小的圖標時完全沒有反應。Kate 指出它只是做了一個非常簡單的模擬,底部導航可點擊,但搜索、分類、頭像、卡片等都是 Canvas 畫出來的靜態元素。經過提示後,5.5 又花了 10 分鐘優化,但只跳出提醒而沒有實際功能跳轉。

Kate 的反思很清楚:一開始的提示要非常明確,要讓 AI 把功能做進去,而不是做一個看起來漂亮的模擬。否則花了四五十分鐘,介面雖然漂亮但功能基本沒有。

接著她讓 5.5 從生成的概念圖製作理髮網頁。GPT-5.5 先使用圖片生成工具給出四個方向,再根據選定的風格生成完整頁面。這次的設計水準明顯比之前版本提升很多,服務預約流程和護理資訊頁面的質感都相當不錯。

不過 Kate 也發現 AI 偷懶了——它直接使用之前生成的參考圖片,沒有重新調用圖片生成工具。

日常工作應用:商業規劃到 PPT 生成

Kate 給 5.5 一個模糊的商業想法——銷售定制 3D 打印的 NASA 主題珠寶——要求它從市場研究到供應鏈、網站建設到行銷策略完整規劃。

5.5 思考了 4 分鐘就給出詳細回答,包括商品定位、產品線、法律合規底線、市場判斷等。只是內容太多查看不便,Kate 便調用 PPT 插件讓它生成簡報。

過去 GPT 內置的 PPT 技能生成速度極慢,因為花很多時間在文字溢出和邊界檢查上。但 5.5 的 PPT 生成速度快了很多,幾分鐘就完成 4 頁簡報。封面、市場驗證策略、合規考量、供應鏈分析——每一頁的樣式都相當豐富,文字溢出問題也基本消失。

科學研究與數據分析能力

Kate 讓 5.5 探索 DeepSeek 最新開源倉庫並生成科普介紹書。GPT-5.5 自動淺克隆倉庫,發現沒有論文 PDF 後,自己根據倉庫內容找到去年 4 月份的論文並下載,最後生成 5 張高品質科普圖片。

接著她測試 5.5 的財報分析能力——從特斯拉投資者頁面下載最新季度財報 PDF 和 Excel 文件,提取關鍵指標並建立圖表頁面。5.5 完成後還自動截圖檢查品質,最終交付的 HTML 頁面含豐富圖表,Excel 表格也完整填入關鍵數據。

唯一的遺憾是中英文夾雜,改成純中文會更好。Kate 提到之前有觀眾問做研究該用什麼模型,她的回答是「無腦推薦 GPT-5.5 Pro」。

創意生成:樂譜編輯器、3D 場景與動畫

在創意工具方面,5.5 製作了一個可視化樂譜編輯器,可以播放小星星、用橡皮刪除音符、添加二分或四分音符,導出功能也正常運作。Kate 特別提到右側邊欄的概覽功能很實用,可以看到進度、生成結果和用到的工具。

3D 場景生成方面,Kate 讓多個模型生成「纖夫拉船」場景,5.5 的表現最為出色——水流流動有規律,船隻質感接近古代運輸船,纖夫的繩索雖然沒有完全連接好,但整體畫面已經非常優秀。

Macaron 色花海的表現更是讓 Kate 讚不絕口——蝴蝶色彩繽紛,調整顏色主題時會整體調整背景而非只換單一顏色。最後 Kate 將 GPT-5.5 的博文鏈接直接丟給 Codex,要求生成兩分鐘衝擊感動畫影片。5.5 先獲取資訊、撰寫分鏡,然後開始組裝。最終生成的塗鴉風格動畫讓 Kate 直呼「畫面實在太有衝擊感了」。

QA 精選

Q1:GPT-5.5 的編碼能力真的比 Opus 4.7 強嗎?

根據 Kate 的實測和多位提前使用的博主回饋,5.5 在編程方面確實有跨越式進步,而且非常易於交流。在工程師基準測試中獲得了非常高分數。

不過在計劃質量方面,5.5 仍然遜於 Opus 4.7。具體來說,前端和全棧產品開發上 5.5 不如 Opus,且在沒有計劃的情況下進行 Web coding 時表現也不如 Opus。

業界公認的最佳策略是讓 Opus 4.7 做計劃、5.5 去執行。這意味著兩者並非替代關係,而是互補關係。

Q2:從圖片生成應用這個流程真的實用嗎?

Kate 的實測顯示目前還不算完全成熟。她讓 5.5 根據圖片生成 Android 應用,花了 42 分鐘,畫面雖然漂亮但功能幾乎是空殼——底部導航可點擊,但裡面的圖標都是 Canvas 畫出來的靜態元素。

關鍵問題在於初始提示不夠明確。她建議一開始就要求 AI 把功能完整做進去,而不是先做模擬再迭代。相比之下,從圖片生成網頁應用的效果就好很多,理髮頁面的質感相當不錯。

所以目前比較可靠的路徑是:先從圖片生成網頁原型確認方向,再針對功能進行迭代,而不是一次就期望完整的 App。

Q3:GPT-5.5 的價格這麼高,值得升級嗎?

API 價格(輸入 5 美元、輸出 30 美元)確實比 Opus 4.7 更高,但 Sam Altman 的說法是因為智力提高,每個任務的 token 用量更少,整體成本未必增加。

Kate 的實測顯示 5.5 在日常工作效率提升上非常顯著——從編碼到 PPT 生成到研究分析,單一任務的處理速度都比前代更快。

如果以產出價值來衡量,對於重度使用者來說升級是值得的,尤其 Kate 明確表示做研究「無腦推薦 GPT-5.5 Pro」。對於輕度使用,5.4 可能已經足夠。

Q4:GPT-5.5 能取代 Codex 嗎?

兩者是相輔相成的關係。GPT-5.5 本身可以在 Codex 環境中使用,且 Codex 這次也有不錯的更新——可以通過 add browser use 插件讓 Codex 直接與 Web 應用交互測試點擊。

Codex 的插件生態非常豐富,但如果你的電腦之前安裝了 AutoGPT 的相關 skill,提問時調用某個 skill 可能會調用到舊版本。

Kate 建議使用 OpenAI 官方提供的文檔和 Excel 表格來讓 5.5 發揮最佳能力。對於快速原型開發(如透明水族箱應用 9 分鐘完成),5.5 在 Codex 中的表現非常出色,但並不能完全取代 Codex 本身。

主編隨筆

Kate 在影片中展示了 GPT-5.5 在十多個不同場景的真實表現,從桌面應用到動畫影片,覆蓋面相當全面。不過我認為最值得留意的不是 5.5 的強項——編碼和日常工作效率提升——而是它的兩項結構性短板。

首先是計劃能力的差距。5.5 在需要深思熟慮的場景仍然不如 Opus 4.7,這說明 OpenAI 的「智力提升」主要體現在執行效率而非策略規劃。如果你的工作流程需要先規劃再執行,目前的最佳組合仍是 Opus 做計劃、5.5 來實現。

其次是「偷懶」問題。從 Android 應用的空殼模擬到理髮網頁重用舊圖不重新生成,5.5 在沒有明確約束時傾向於走捷徑。這不是能力問題而是行為偏好——它會優先選擇看起來合理的方案而非最完整正確的方案。這意味著使用 5.5 時,提示詞的品質比以往任何時候都更關鍵。模糊的指令會得到漂亮的空殼,精確的指令才能釋放它真正的潛力。

結語

GPT-5.5 無疑是目前公開可用最強的模型之一,尤其在編碼效率和研究分析方面表現出色。但它並非全能——計劃能力落後 Opus 4.7、在無明確指令時容易偷懶,都是實際使用時要注意的地方。

對於一般使用者來說,5.5 在日常工作效率上的提升非常值得升級;對於開發者而言,善用 Opus + 5.5 的分工組合可以達到最佳效果。Kate 的實測讓我們清楚看到,AI 工具的進步不僅體現在能力上限的提升,更體現在如何寫好提示詞來引導這些能力。

本文章僅作為學習與交流用途,不構成任何投資建議。 原始內容版權歸原節目製作人所有。本網站內容經 AI 輔助整理,並經人工審核後發布,可能仍包含錯誤。 詳見 版權聲明與免責條款