AILIFELAB.CO VOL. 2026 · 07
AI 生活實驗室
工具實測 2026 · 07 · 10

GPT-5.6 哪裡強?Sol vs Fable 5 對戰結果+我的課金實測計畫

如果你是在我的影片下面留言「gpt」被小編傳送過來的——對,整理就是這篇哈哈,直接往下看。

昨天發生什麼事

2026/7/9 OpenAI 大更新,重點三件:

  1. GPT-5.6 全面開放,一次出三個型號:Sol(太陽)旗艦、最聰明的那顆;Terra(地球)均衡款,夠強又便宜一半;Luna(月亮)最快最省,小事交給它。以後命名規則固定:數字是世代、名字是等級。
  2. 旗艦 Sol 居然包含在 Plus 方案(US$20/月)裡——不用升 Pro、不用另外接 API。這是這次最大的話題點,也是我的 Claude 小精靈在影片裡嚇到的原因。
  3. Codex 跟著更新:併入 ChatGPT 桌面版(Mac/Windows)、電腦操作變快、新增 Ultra 模式(四個 agent 並行做大任務,Codex 從 Plus 就能用)。

Sol vs Fable 5,打九回合誰贏?

前五回合來自 OpenAI 官方發布的對標表,後面幾回合是第三方公開評測,我翻成白話:

回合比什麼SolFable 5勝者
1長時間自動任務(Agents’ Last Exam)52.740.5Sol
2終端機自動化(Terminal-Bench 2.1)88.883.1Sol
3深度網路查資料(BrowseComp)90.4未公布Sol(沒對手)
4寫程式 agent 綜合(Coding Agent Index)80.077.2Sol 小勝
5真實專案寫 code(SWE-Bench Pro)64.680.0Fable 大勝
6商業工作品質(GDPval Elo)1747.81759.6Fable 小勝
7綜合智力(AA 智力指數)58.959.9Fable 小勝
8長文寫作(EQ-Bench 創意寫作 Elo)未公布(上一代 GPT-5.5 是 2028)2189,榜首Fable
9自主運作時間(能自己連續做事多久)METR 估 11.3 小時官方展示 9 小時以上、agent 可連跑多天難直接比

老實說幾件事。Sol 贏的那幾項多半是 OpenAI 自己挑的主場,而且除了長時間自動任務,差距都不大;Fable 這邊,真實專案寫 code 贏 15 分以上,長文寫作更是榜首等級——要寫文案、寫長文的人可以直接參考第 8 回合。

自主運作時間那條要特別說:METR(專門測 AI 能自己連續工作多久的機構)給 Sol 估 11.3 小時,但同時抓到它在評測裡「走捷徑刷分」的比例創了該機構史上紀錄,連他們自己都說這個數字要保留看待;Fable 那邊是官方展示拿一份 15 頁規格書自己跑了 9 小時以上,agent 掛著可以連跑好幾天。兩邊測法不同,很難直接比,但至少 Claude 這邊沒有刷分爭議。

結論:各有千秋——自動任務、查資料 Sol 強;寫 code、寫文案、長時間穩定輸出還是 Claude。誰跟你說一面倒,他在帶風向。

平常只用免費 AI 的人,可以玩什麼?

如果你還停在「AI = 問問題的聊天框」,這波值得試的是這些:

  • 做簡報變超聰明:推理強+image-2 生圖,一句話生出整份簡報,連配圖都幫你畫好
  • 影片也能叫它剪:Codex 會寫程式,能幫你跑自動剪輯這類的活
  • 工具串工具變簡單:查資料 → 生圖 → 排版一條龍,不用自己在十個網頁間搬來搬去
  • 公司要大量用更省:旗艦 API 價($5/$30)約是 Fable 5($10/$50)的一半,Terra 更是俗又大碗

這些 Plus US$20/月就能開始玩;免費版在部分功能也摸得到 Terra。

我自己想課金實測的三件事

我同時管理 2 間企業+1 個協會,日常工作流已經全部跑在 Claude 上,所以我的測法是「拿真實工作對打」,不是跑考題。

1. 工作流自動化+資料結構設計

我之前把自己的做法整理成一篇:一人公司工作流自動化,5 步就好。這套流程本身不綁定哪家模型——你完全可以照這 5 步,改用 GPT-5.6 走一遍試試看。它的「長時間自動任務」分數是九回合裡贏最多的,理論上這種多步驟的活它應該擅長,我會拿同一條流程讓兩邊對打。

2. 策略規劃

我會把三個組織的現況、資源、目標丟給它,看它做跨組織的資源配置像不像「真的懂經營的顧問」。這部分每個人在想的事情不一樣,就不展開了——你有自己的版本就拿自己的試。

3. 影像相關應用(我最期待的)

這條我自己都還沒試過,但感覺會很厲害:用 image-2 畫分鏡圖,再接 Higgsfield/Kling 這類工具生成影片。我之前用同樣思路做過完整的片子,這兩篇可以直接參考:

現在 image-2 生圖就包在 GPT-5.6 的方案裡,把「分鏡圖」這一段換成它來畫,理論上一個訂閱就能把前半段做完。

自動剪輯也一樣有現成路線可以抄,我之前寫過:

這兩篇的核心做法(轉逐字稿 → 定義什麼該剪 → AI 動刀你拍板)拿到 Codex 上面試試看,看它寫程式剪片的實力跟 Claude 差多少——第五回合它輸的就是這種真實動手活,我蠻好奇實戰會不會不一樣。

測完會發生什麼事

我會把實測心得做成影片跟大家說。跳槽不急,先搞清楚它強在哪——有興趣的話,一起玩玩看。


*分數來源:回合 1–5 為 OpenAI 官方發布之對標表;GDPval、AA 智力指數、EQ-Bench 創意寫作為第三方公開評測;自主運作時間為 METR 評測(含其對 Sol 刷分行為之公開說明)與 Anthropic 官方展示,各項均經多方媒體交叉確認。

想用 AI 讓生活與工作更輕省,追蹤 AI 生活實驗室 👉 @life.coach.mtcity,我們一起玩 AI!