ARC-AGI-3 分數翻三倍是這篇文章討論的核心

📑 目錄導航
💡 快速精華區
📊 關鍵數據:OpenAI GPT-5.6 Sol 在 ARC-AGI-3 上透過兩個設定調整,分數從約 10% 躍升至 30% 以上,提升幅度達三倍。目前 ARC-AGI-3 最高分為 Claude Opus 5 的 30.2%,但前沿模型距離人類 85% 的 AGI 門檻仍有巨大落差。預計到 2027 年,ARC-AGI 系列基準測試將成為市值超過 5000 億美元的 AI 推理優化市場的核心評估工具。
🛠️ 行動指南:企業 AI 團隊應立即將 ARC-AGI 表現納入模型選型考量;開發者關注 Retained Reasoning 與 Canonical Compaction 技術細節;投資人追蹤四大實驗室(OpenAI、Anthropic、Google DeepMind、xAI)的模型卡片更新。
⚠️ 風險預警:ARC-AGI-3 分數的提升不代表真正的 AGI 突破,需警惕「刷分」與「實際能力」之間的鴻溝。成本效益比(每題花費 vs. 正確率)仍是關鍵指標。
引言:兩行設定的「魔法」
說實話,第一次看到這則消息時,我的反應是「蛤?兩行設定?」。
2026 年 7 月 30 日,OpenAI 的工程師 Tibo(負責 Codex 與 ChatGPT 的那位)在社群平台上丟出一顆震撼彈:他們的 GPT-5.6 Sol 模型在 ARC-AGI-3 基準測試上達到了現階段的 State-of-the-Art(SOTA)水平,而秘诀竟然是「just two setting changes」——僅僅兩個設定的切換,就讓分數翻了三倍。
你沒看錯,不是花了幾億美金去訓練新模型,不是架構大改,而是啟用了 Retained Reasoning(保留推理)和 Canonical Compaction(標準壓縮)這兩個功能。這操作簡單到讓人懷疑人生——就像你以為要解一道微積分,結果發現答案是 1+1=2。
但別急著下結論。ARC-AGI-3 可不是什麼普通的考試,它被 François Chollet(Keras 創建者、ARC Prize 基金會共同創立者)設計出來,專門戳破 AI 的「推理假象」。這篇文章要帶你深入挖掘:這兩個設定到底是什麼魔法?ARC-AGI-3 的設計邏輯藏著什麼秘密?以及這對 2026 年下半年的 AI 產業意味著什麼?
ARC-AGI-3 到底在測什麼?為什麼它被稱為「AGI 照妖鏡」?
要理解 OpenAI 這波操作的含金量,你得先搞懂 ARC-AGI-3 是什麼來頭。
ARC(Abstraction and Reasoning Corpus,抽象與推理語料庫)系列測試由 Chollet 在 2019 年提出,核心理念是:真正的智能不是死記硬背,而是面對全新情境時的即時推理與泛化能力。用大白話說,就是看你能不能舉一反三。
ARC-AGI-3 是這個系列的第三代,2026 年初正式推出。它跟前兩代最大的不同在於:互動性。ARC-AGI-1 和 2 測的是被動的流動智力(就是給你一題,你解答),但 ARC-AGI-3 要求 AI 在全新的互動環境中「邊做邊學」,就像把你丟到一個完全陌生的國家,看你能多快適應。
ARC-AGI-3 包含多模態的推理任務,涵蓋邏輯推理、數學、程式設計、符號語義理解等領域。每個任務都是 AI 從未見過的全新謎題,設計原則是:對人類來說相對容易(人類正確率約 85%),但對 AI 來說極具挑戰性。這就是為什麼它被稱為「照妖鏡」——刷榜慣用的死記硬背在這裡完全派不上用場。
🔧 Pro Tip 專家見解:
François Chollet 曾經直言:「智能是系統在給定先驗知識、經驗和泛化難度下,對一系列任務的技能獲取效率的衡量。」 ARC-AGI 系列的核心就是在測「學習效率」,而不是「記憶量」。這也解釋了為什麼參數量破兆的大型語言模型在這裡常常翻車——它們擅長的是「已知問題的模式匹配」,而不是「未知問題的即時推理」。
ARC-AGI-3 的評分機制也相當獨特:採用 pass@2 機制,也就是每個任務跑兩次,取最佳結果,以此消除個別任務的潛在歧義。它包含 1000 筆訓練資料,以及三組各 120 筆的評估集,所有題目都經過人類驗證可解。
OpenAI 的兩把鑰匙:Retained Reasoning 與 Compaction 到底在搞什麼鬼?
好了,重點來了。OpenAI 的 Tibo 說他們用了「兩個設定」就讓分數翻三倍,這兩個設定分別是:
1. Retained Reasoning(保留推理)
這個功能允許模型在處理多個 context window(上下文窗口)時,能夠「記住」之前的推理過程。說白了,就是讓 AI 有更強的「工作記憶」——不是每次都要從頭開始想,而是可以累積之前的思考成果。
這很關鍵,因為 ARC-AGI-3 的互動式任務往往需要多步驟的推理鏈。如果模型每換一個 context 就失憶,那基本上就是個金魚腦,怎麼可能解得出複雜謎題?
2. Canonical Compaction(標準壓縮)
這個更玄學一點。它是一種資訊壓縮技術,讓模型在有限的 context window 中塞入更多有意義的資訊,而不是被無關的 token 淹沒。你可以把它想像成「聰明的摘要」——不是刪掉一半內容,而是精準地保留關鍵推理節點。
🔧 Pro Tip 專家見解:
這兩個設定的組合拳揭示了一個重要趨勢:2026 年的 AI 優化重心正在從「訓練端」轉向「推理端」。過去大家瘋狂堆算力、拼參數,現在的前沿研究開始關注「如何讓模型在推理時更聰明」。OpenAI 這波操作本質上是在說:「我們不用重訓模型,只要改變推理策略,就能榨出三倍性能。」這對整個產業的成本結構影響巨大。
根據 explainx.ai 的報導,GPT-5.6 Sol 透過這兩個設定的組合,在 ARC-AGI-3 上達到了 SoTA 水平,與 Claude Opus 5(目前排行榜第一,得分 30.2%)形成激烈競爭。有趣的是,這不是透過暴力堆砌算力達成的,而是「推理策略的優化」。
產業鏈衝擊:2026 年 AI 推理市場的版圖正在重劃
這波突破的影響力遠超 ARC-AGI 排行榜本身。讓我拆解幾個關鍵面向:
成本結構的典範轉移:過去要提升 AI 模型表現,最直覺的做法是砸錢訓練更大的模型。但 OpenAI 這波操作證明,「推理端優化」的 CP 值可能遠高於「訓練端擴張」。根據 Next Big Future 的報導,ARC Prize 2025 競賽吸引了 1,455 支隊伍和 90 篇論文投稿,test-time training(測試時訓練)成為突破性技術,這暗示著未來的投資熱點可能會從「訓練基礎設施」轉向「推理優化基礎設施」。
模型評估標準的正當性:ARC-AGI-3 已經不是小眾實驗室的玩具了。根據 arxiv.org 的論文,四大 AI 實驗室——OpenAI、xAI、Anthropic、Google DeepMind——都在各自的模型卡片中公開報告 ARC-AGI 表現。這意味著 ARC-AGI 已經從學術基準晉升為「業界標準」。對企業買家來說,選購 AI 模型時,ARC-AGI 分數可能會成為類似 CPU 基準測試的關鍵指標。
2027 年的市場預測:隨著 ARC-AGI 系列被各大實驗室採用,圍繞「AI 推理能力評估與優化」的生態系正在快速成形。ARC Prize 基金會、BenchLM.ai 等第三方評估平台的影響力將持續擴大。保守估計,到 2027 年,AI 推理優化相關的工具鏈和服務市場規模可能突破 500 億美元,成為 AI 產業鏈中成長最快的細分賽道之一。
🔧 Pro Tip 專家見解:>
對企業而言,這波趨勢的實務意涵是:不要再只看模型的「靜態基準分數」(如 MMLU、HumanEval),開始追蹤「動態推理表現」。ARC-AGI-3 的設計理念是測試「你在完全陌生的情境中能多快適應」,這才是真實商業場景中最常見的挑戰。未來兩年,企業 AI 部署的成敗,可能取決於模型在 ARC-AGI 類基準上的真實推理能力,而不是它能背多少 Wikipedia。
四大實驗室的角力:ARC-AGI 為何成為 AI 的「必考科目」?
一個基準測試能讓四大互為競爭對手的 AI 實驗室同時將結果寫進模型卡片,這本身就夠離奇。讓我們看看 ARC-AGI 為何能獲得如此高的產業認可度。
公平性設計:ARC-AGI 的題目都是「反死記硬背」的。它不測你能背多少知識,只測你面對全新問題時能不能推理。這對所有模型都是公平的——不管你參數多大、預訓練資料多豐富,來到這裡都得從零開始想。
人類基準線明確:人類正確率約 85%,這給了所有人一個清晰的「及格線」。不是那種「越高越好」的無限遊戲,而是有明確目標的「85% 挑戰」。
成本效益透明:ARC Prize 的排行榜不只看正確率,還追蹤「每題成本」。根據 arcprize.org 的數據,目前最高分的驗證方案(基於 Gemini 3 Pro)得分 54%,但每題成本高達 30 美元。這提醒我們:分數高不高是一回事,花多少錢拿到這個分數是另一回事。
ARC-AGI-3 的排行榜目前呈現一個有趣的格局:Claude Opus 5 以 30.2% 微幅領先,OpenAI 的 GPT-5.6 Sol 緊追在後,兩者差距極小。而根據 benchlm.ai 的數據,目前共有 11 個模型在 ARC-AGI-3 上進行過評估,最強與最弱之間的差距高達 30 個百分點——這在 AI 評估史上相當罕見,代表這個基準依然有極高的區分度。
更值得關注的是:即便是最強的模型(30.2%),距離人類基準(85%)還有超過 55 個百分點的差距。這提醒我們,通往真正 AGI 的路還很長。正如 Fast Company 報導的,Chollet 認為 OpenAI 在 2025 年花了「數千萬美元」的運算資源來專門訓練 ARC-AGI-2 的模型,但 ARC-AGI-3 的互動式設計讓這種「針對性訓練」變得更加困難。
常見問題 FAQ
ARC-AGI-3 與傳統 AI 基準測試有什麼不同?
ARC-AGI-3 與傳統基準的最大差異在於「互動性」與「泛化測試設計」。傳統基準如 MMLU、HumanEval 主要測試模型的記憶與模式匹配能力,題型相對固定。但 ARC-AGI-3 的每道題都是 AI 從未見過的全新謎題,要求模型在互動環境中即時推理和學習,人類正確率約 85%,而目前最強 AI 模型僅達 30% 左右,這就是所謂的「AGI 鴻溝」。
OpenAI 的 Retained Reasoning 與 Compaction 技術是如何提升 ARC-AGI-3 分數的?
Retained Reasoning(保留推理)讓模型在跨多個上下文窗口時能維�推理鏈的連續性,避免「失憶」問題。Canonical Compaction(標準壓縮)則是一種智能摘要技術,在有限的上下文窗口中保留關鍵推理節點。兩者結合讓 GPT-5.6 Sol 在不改變模型架構的情況下,將 ARC-AGI-3 分數從約 10% 提升至約 30%,實現三倍的性能躍升。
ARC-AGI-3 分數提升到多少才算是達到 AGI 水準?
根據 ARC Prize 基金會的定義,當 AI 系統在 ARC-AGI 系列測試中的正確率穩定達到 85%(相當於人類平均水平)時,才被認為符合 AGI(人工通用智能)的門檻。目前最強的模型僅達 30% 左右,距離 AGI 還有超過 55 個百分點的差距。
行動呼籲與參考資料
如果你對 AI 推理能力的最新進展感興趣,或者你的企業正在評估下一代 AI 模型的導入方案,歡迎與我們聯繫。siuleeboss.com 的團隊專注於 AI 產業趨勢分析與技術落地顧問服務。
參考資料與權威來源
Share this content:













