
Gary Talks Stuff:你不是不會寫 Prompt,是不會定義任務
Gary 指出大多數人還在用「實習生模式」跟 AI 工作,但模型早已升級到 Senior Partner 等級。真正的差距不是 prompt 寫得多漂亮,而是會不會用五欄位 brief 框架來定義任務。

Gary 指出大多數人還在用「實習生模式」跟 AI 工作,但模型早已升級到 Senior Partner 等級。真正的差距不是 prompt 寫得多漂亮,而是會不會用五欄位 brief 框架來定義任務。

Kate 深度評測 Claude Fable 5 系列模型,從 Cursor Bench 到複雜前端任務全面比較 GPT 5.5。結論:能力確實頂尖,但價格也確實驚人,安全防護更是令人頭痛。

Gary 深度解析 Claude Dynamic Workflow 的核心運作原理,以及它與 Subagent、Agent Team、Skill、Go 指令的關鍵差異,並分享實戰使用場景與節省成本的三個技巧。

K 實測 Google Gemma 4 12B 多模態模型,從 MTP 加速到中文語音辨識全方面評測,結論是輕量級小模型完成度不錯,但中文支援仍在路上。

Anthropic 發布 AI 新創 Playbook,提出 AI-native startup 的四階段框架:Idea、MVP、Launch、Scale。Gary 深入解析 AI 如何改寫創業流程,以及創業者如何用 Claude 全家桶建立真正的 workflow,避免掉入「更快做出沒人要的東西」的陷阱。

嘉嘉實測 MiniMax M3,從 macOS 應用開發到舊專案改造,驗證 1M 長上下文與原生多模態在真實編碼場景中的表現,並分享與 GPT-5.5 搭配使用的經濟組合策略。

Gary 教你用四步驟把傳統的 Human SOP 拆解成 Agentic Workflow:從格式標準化、任務拆解、雙向開發到整合執行環境,讓非技術人員也能設計出真正可上線的 AI 自動化流程。

開甲實測 Claude Opus 4.8 與 GPT 5.5 在 8 個前端交互任務的表現,最終 GPT 5.5 以平均 92.2 分勝過 Opus 4.8 的 90.5 分。深入分析兩大模型在材質表現、狀態建模與動畫模擬上的優劣。

Kate 實測 Grok Build 0.1、GPT 5.5 與 Cursor Composer 2.5 在 17 個複雜前端交互生成任務上的表現,從代碼深度、視覺風格、交互完整性等面向進行橫向對比。

凱特實測千問 Qwen3.7-Max 的多項核心能力,從多語言翻譯、創意寫作、編程到全端應用開發,看看這款被譽為最強國產模型的表現究竟如何。

凱特實測 Google I/O 2026 最新 AI 產品:Omni Flash 圖像生成、Gemini 3.5 Flash 速度測試、Canvas 2.0 互動創作平台、Flow Agent 模式全流程評測,並對比 GPT 陣營的影像生成能力。

凱特實測四種在 Mac 上運行千問 3.6-27B 的方案,從官網、GGUF、MLX+Dflash 到 MTPLX,發現 MTPLX 四比特的生成速度翻倍達 43.6 tok/s,是最適合 Mac 用戶的選擇。

K 實測 GPT 5.5 Pro 在搜尋、寫報告、寫程式各方面的表現,從數學研究到個人理財規劃,檢視這款 OpenAI 高階模型的真實生產力水準。

Kate 實測 OpenAI Codex 最新 Chrome 瀏覽器插件,從自動瀏覽論壇、整理郵件到多代理並行玩遊戲,展示 GPT-5.5 如何讓 AI 真正能自己開瀏覽器幹活。

傑德實測 DeepSeek V4 Pro,從寫作、程式到論文解讀完整分析。V4 Pro 在 SW-bench 超越 GPT-5.5,但知識類任務仍不及 Gemini 3.1 Pro。深入解讀 CSA/HCA 注意力機制與 Magic MOE 工程創新。

Kate 實際測試 GPT-5.5 在編碼、研究、PPT、App 生成等場景的表現,從透明水族箱桌面應用到動畫影片製作,全面評測 5.5 的強項與短板。

K 实测了小米最新发布的 MiMo V2.5 Pro 模型,在十字路口交通仿真、3D 场景生成、复古相机模拟等多项任务中展现了惊喜的编码能力,但也暴露了输出中断、预览失效等稳定性问题。与 Opus 4.7 和 K 2.6 的对比评测,值得 AI 开发者参考。

GPT-Image-2 的中文字體渲染能力令人驚豔,從 iOS 介面設計到工程藍圖、教科書批改到復古菜單,實測 25 個場景驗證其文字生成極限與應用潛力。

Kimi K2.6 正式開源,SW-bench 達 58.6 超越 GPT-5.4!K醬深度實測編碼、前端復刻、多 Agent 集群三大核心能力,並與 Opus 4.7、千問 3.6 Max 全面對比。

凱特實測 Qwen3.6-Max-Preview 與 Claude Opus 4.7,從冰馬勇接舞、復古相機模擬器、書法平台到縴夫拉船共六個場景全面對比。3.6-Max Preview 生成速度快、創意足,但 Opus 4.7 在細節與精緻度上仍略勝一籌。