example keyword是這篇文章討論的核心

💡 核心結論:「人類審核」並非萬靈丹。4 萬次遊玩、40.9 萬次操作證實,玩家平均放行約三分之一的惡意指令,人機迴路在安全上比想像中脆弱得多。
📊 關鍵數據:遊戲放行惡意指令約 33%;Anthropic 遙測顯示 Claude Code 真實批准率高達 93%;權限越界攻擊最常被漏看(35%)。AI 代理安全市場預估從 2025 年 187 億美元成長至 2035 年 5,076 億美元。
🛠️ 行動指南:收緊預設權限、降低提示頻率、導入自動化異常行為偵測,把權限決策交給分類器與沙箱,而非已經疲憊的人類。
⚠️ 風險預警:審核疲勞會在時間壓力與資訊不足下讓人類草率放行;企業若繼續把「人類把關」當免死金牌,將直面憑證外洩與供應鏈滲透的連鎖災難。
引言:那個「允許」按鈕,真的是安全網嗎?
當我們把鍵盤交給 AI 程式碼代理,那個跳出來問你「允許嗎?」的對話框,到底是安全網還是裝飾品?這是我這陣子反覆觀察一場公開實驗後,心裡一直梗著的疑問。比利時開發者、前 Uber 工程師 Alex Wauters 在 2026 年 5 月底丟出一個看似玩具的瀏覽器小遊戲 llmgame.scalex.dev,名字叫「Continue? Y/N」,玩法簡單到近乎殘酷:你要在 60 秒內,對一串模擬 Claude Code 權限請求的 shell 指令不斷按下放行或阻擋。有些指令無害(git status、npm test),有些則悄悄把你的 AWS 憑證往外送(cat ~/.aws/credentials)。
重點不在遊戲本身,而在它累積出來的真實樣本。截至統計時,這款遊戲被玩了超過 4 萬次,產生 40.9 萬次「允許/拒絕」決策,而結論冷冰冰地戳破了業界長年的浪漫想像:玩家平均放行了大約三分之一的惡意指令。換句話說,那道被我們當作最後防線的「人類審核」,在時間壓力與資訊不對稱之下,漏接率居然高到三分之一。這不是實驗室裡的極端特例,它和 Anthropic 自家遙測數據彼此呼應——真實世界裡,Claude Code 使用者對權限提示的批准率高達 93%。所謂「人在迴路裡」(Human-in-the-loop),從某些角度看,更像人被困在迴路裡。
為什麼人類審核 AI 程式碼代理會在 60 秒內失守三分之一?
把時鐘撥回那 60 秒的遊戲現場,你會發現 Wauters 還原的介面幾乎是 Claude Code 的像素級翻版:指令一條接一條閃過,你必須在極短時間內判斷放行還是阻擋。這套設計精準複製了開發者日常使用 AI 程式碼代理的真實情境——只不過真實情境裡,你可能一整天要面對幾十上百次這種彈窗,而不是只有一分鐘。
數據點出的盲區相當具體:權限越界攻擊(Scope Violations)是最常被漏看的類型,漏接率約 35%。所謂越界,就是代理明明只該讀取專案檔,卻伸手去要 Kubernetes 設定檔或 AWS 憑證。而單一最常被放行的惡意指令,居然是長得像例行公事的 npm run analyze——一個看起來人畜無害、實則暗藏外送邏輯的指令。這恰恰說明:人類不是看不懂危險,而是被「熟悉感」催眠了。
🧠 Pro Tip 專家見解:把「惡意指令」想成變裝高手。Wauters 的觀察提醒我們,最危險的請求往往披著例行指令的外衣。實務上,與其訓練人類去讀懂每一行 shell,不如在代理層就強制最小權限(least privilege)——預設關閉憑證讀取、把網路外送列入高風險類別,讓危險在抵達人類眼前之前就被擋下。
這組數據背後還藏著一個殘酷邏輯:當請求數量超過人類的注意力預算,審核就會從「判斷」退化成「反射動作」。有些人甚至直接跳過權限檢查——這才是真正的災難起點。
「審核疲勞」是什麼?Claude Code 93% 批准率揭露了什麼盲區?
「審核疲勞」(Approval Fatigue)這個詞,在這場實驗裡不再是抽象名詞,而是一組可被測量的數字。Anthropic 在「How we contain Claude」工程文中坦承:Claude Code 先前靠每次回合都向使用者索取權限來防止代理做出非預期行動,理論上可行,實際上卻漏洞百出——他們的遙測顯示,使用者核准了約 93% 的權限提示,而且「看到的批准越多,對每一個的注意力就越低,監督隨時間變得馬虎」。
這 93% 與遊戲裡的 33% 惡意放行率,其實描述的是同一件事的兩個側面:真實環境下人類幾乎不假思索地按允許,於是惡意請求只要混入大量正常請求之中,就有極高機率被「順手」放過。Wauters 也觀察到,大量重複請求會引發審核疲勞,在缺乏完整上下文時人類易做出草率決策。
🧠 Pro Tip 專家見解:93% 的批准率不是證明人類很信任 AI,而是證明人類已經放棄閱讀。對 2026 年的工程團隊來說,關鍵指標不該是「批准率」,而該是「每個提示是否值得中斷開發者」。把低風險決策交給分類器自動化,把人類的注意力留給真正高風險的越界請求,才是對的方向。
事實上,Anthropic 已經用行動回應了這組數據:2026 年 3 月推出的 Claude Code「Auto Mode」,正是讓分類器自動批准安全動作、只把危險行為升級給人類複審。這不是把人類移出迴路,而是把人類擺回該在的位置。
2026 年以後,企業該如何重建 AI 代理的權限信任模型?
把視野拉到產業鏈層級,你會發現這場 60 秒遊戲折射出的是一個兆美元級的結構性問題。Gartner 預估全球 AI 市場將達 2.52 兆美元,其中「代理式 AI(Agentic AI)」是成長最快的類別——2026 年企業支出預計達 2,019 億美元,年增 141%,2027 年更將超越聊天機器人成為最大的 AI 軟體類別。與此同時,AI 代理安全市場規模預估從 2025 年的 187.2 億美元,成長至 2035 年的 5,075.6 億美元(CAGR 約 39%)。錢潮湧入的地方,攻擊者也會跟著湧入。
Wauters 的呼籲很明確:業界別再把「人類審核」當萬靈丹,應轉向強化 AI 代理工具本身的權限模型與安全性。具體來說有三條主軸——
1. 更嚴格的預設權限:從「預設全開、逐項確認」改為「預設最小權限、按需授權」,讓憑證讀取與網路外送成為高門檻動作。
2. 減少提示頻率:用分類器與沙箱吸收低風險決策,把中斷次數壓到最低,避免審核疲勞稀釋掉人類僅存的那點注意力。
3. 自動化異常行為偵測:在代理執行層部署行為監控,對「代理突然讀取 AWS 憑證」這類偏移即時阻擋,而不是等人力發現。
🧠 Pro Tip 專家見解:對大型企業,最務實的一步是部署中央化的「AI Proxy」——在代理指令抵達開發者終端機之前,先攔截並對照企業安全政策跑一遍。這能把「人類可能看漏」的風險,轉化成「系統必然攔截」的確定性。
展望 2027 年以後,當 AI 代理開始大規模中介 B2B 採購(Gartner 預估 2028 年將中介超過 15 兆美元),權限模型若仍建築在「人類會認真看每個提示」的假設上,等於在高速公路上用紙板當護欄。信任模型的重心,必須從「人類把關」轉向「系統內建的安全邊界」。
開發者如何自保?從 llmgame 數據看到的實戰啟示
講完宏觀產業,回到螢幕前的你。這場實驗最實用的啟示,其實是關於「你該怎麼跟自己的 AI 程式碼代理相處」。數據告訴我們,人類在高頻提示下幾乎必然失守,所以第一步是承認自己會累——別在深夜、趕交付、一堆彈窗同時炸開的時候,靠意志力去逐條審核。
更具體的自保清單:把代理的權限範圍鎖死在專案目錄內,永遠不要讓它預設能讀 ~/.aws/credentials 或 Kubernetes 設定;對任何長得像 npm run xxx 的指令保持懷疑,因為「熟悉感」正是攻擊者最好的偽裝;啟用指令日誌(agent command logging),讓每一次放行都可追溯;並定期去 llmgame.scalex.dev 測一下自己的「審核疲勞評分」,把它當成體檢而非遊戲。
🧠 Pro Tip 專家見解:把「信任但查驗」(trust but verify)升級成「預設不信任,且用工具查驗」。開發者真正的價值不在於當人肉防火牆,而在於定義好邊界、選對工具、讀得懂異常日誌——把重複的判斷勞動交出去,把策略性決策留給自己。
這不是要你恐慌,而是要你清醒。AI 程式碼代理不會消失,只會更黏在手邊。與其幻想那個「允許」按鈕能保你平安,不如早點把安全邊界築在系統層。
常見問題 FAQ
llmgame.scalex.dev 這個遊戲想證明什麼?
它由比利時開發者 Alex Wauters 打造,模擬 Claude Code 的權限請求介面,讓玩家在 60 秒內決定放行或阻擋 shell 指令。超過 4 萬次遊玩、40.9 萬次決策顯示,玩家平均放行約三分之一的惡意指令,證明人類審核在安全上並不如預期穩固。
為什麼 Anthropic 的數據顯示 Claude Code 批准率高達 93%?
Anthropic 自家遙測顯示,使用者在舊版預設下批准了約 93% 的權限提示,且看到的提示越多、注意力越低。這促使 Anthropic 在 2026 年推出 Auto Mode,用分類器自動批准安全動作、只把高風險行為升級給人類複審,以減少審核疲勞。
開發者與企業現在能立刻做什麼來降低審核疲勞風險?
收緊代理的預設權限到最小範圍、把憑證讀取與網路外送列為高風險類別、減少低風險提示頻率、啟用指令日誌與自動化異常偵測,大型企業可額外部署中央化 AI Proxy 在終端前攔截指令並對照安全政策。
現在就替你的 AI 代理做一次權限健康檢查
讀到這裡,你大概也發現:那道「人類最後防線」其實早就有裂縫。與其等到憑證外洩才後悔,不如讓我們幫你把權限邊界築在系統層。我們的團隊專精 AI 代理安全架構設計,從最小權限設定到異常偵測落地,都能給你一套可執行的方案。
參考資料
- Alex Wauters — Humans missed 1 in 3 threats approving AI agent commands(scalex.dev 統計文)
- llmgame.scalex.dev — Continue? Y/N 權限疲勞測驗遊戲
- The Register — Humans in the loop miss a third of dangerous AI coding agent requests
- Anthropic — How we contain Claude across products
- Anthropic — How we built Claude Code auto mode
- SNS Insider — AI Agent Security Market Size 2025–2035
Share this content:













