inagent是這篇文章討論的核心


AI 奪權!InAgent 突破 90% 阈值:電腦使用代理(Computer-Use Agent)的新紀元

💡 核心結論: InAgent 在 OSWorld 測試中達成 90.2% 成功率,正式打破 90% 的工業臨界點,標誌著 AI 從「對話式」全面轉向「執行式」。

📊 關鍵數據: 預計到 2027 年,全球 Computer-Use Agent 市場规模將突破 1.2 兆美元,數位勞動力將取代 40% 的重複性桌面操作流程。

🛠️ 行動指南: 企業應立即從單純的 LLM 導入轉向「Agentic Workflow」部署,優先自動化高頻率、跨軟體的 SOP 流程。

⚠️ 風險預警: 權限過大導致的安全漏洞(Prompt Injection)與 OS 級別的隱私洩露將成為 2026 年最大的資安挑戰。

說實話,看到 InAgent 刷出 90.2% 這個數字時,我第一反應是:「這數據是不是太誇張了?」在 AI 圈子裡,我們習慣了 OpenAI 或 Anthropic 領跑,但這次中國團隊直接把這道牆給拆了。我觀察了這陣子 Computer-Use Agent 的演進,以前的 AI 像個「指揮官」,你告訴它怎麼做,它給你建議;但 InAgent 像是個「實幹派」,它直接接管你的滑鼠和鍵盤,在真實的 OS 環境裡瘋狂操作。這不是小修小補,而是從 0 到 1 的物種進化。

InAgent 為什麼能讓 OpenAI 和 Google 臉色大變?

簡單來說,目前的 AI 代理(Agent)大多還在「模擬」操作,或是依賴特定的 API 接口。但 InAgent 走的是另一條路:它能像真人一樣「看」屏幕、「點」按鈕、「打」文字。在 OSWorld 的殘酷測試中,它不僅在瀏覽器裡如魚得水,甚至在複雜的桌面軟體操作中達到了 100% 的系統級任務成功率。

Pro Tip 專家見解: 過去我們追求的是 LLM 的推理能力(Reasoning),但 2026 年的競爭核心已轉向「執行工程」(Harness Engineering)。誰能更精準地將視覺感知(Vision)與坐標操作(Action)同步,誰就掌握了數位勞動力的入場券。

對比一下目前的格局,OpenAI 的 Operator 和 Anthropic 的 Computer Use 雖然強大,但在處理「跨軟體長路徑任務」時,經常會出現視覺漂移或邏輯斷層。而 InAgent 透過優化端到端的自動化流程,直接把成功率拉高到 90% 以上,這讓那些還在研究如何讓 AI 寫好郵件的對手們感到壓力山大。

AI Agent 成功率對比圖展示 InAgent 與其他頂尖 AI 在 OSWorld 基準測試中的成功率對比AI 模型成功率 (%)OpenAI (約 38%)Anthropic (約 22%)InAgent (90.2%)

OSWorld 90.2% 的含金量到底在哪?

很多人對基準測試(Benchmark)沒什麼感覺,但 OSWorld 不是那種簡單的選擇題。它模擬的是真實的電腦環境,包含:

  • 多場景切換: 從 Excel 提取數據 $rightarrow$ 在 Slack 發送消息 $rightarrow$ 在瀏覽器提交表單。
  • 動態環境反應: 面對彈窗、緩慢的加載速度或非預期的系統通知,AI 能不能不崩潰?
  • 端到端執行: 不需要人類在中間點擊「確定」,AI 必須獨立完成整個任務閉環。

在這種測試下能突破 90%,意味著 AI 已經具備了「通用電腦操作能力」。這就像是從一個只能在特定路徑走的人,變成了一個能開地圖在陌生城市自由行走的人。

2026-2027 產業鏈大洗牌:數位勞動力時代來臨

想像一下,到 2027 年,你不再需要學習複雜的 ERP 系統或 CRM 操作。你只需要對著電腦說:「幫我把上個月所有超過 5 萬元的訂單整理成報表,分析出成長原因,並擬好給 CEO 的簡報。」然後,你就看到滑鼠在屏幕上飛快地閃爍,所有軟體自動切換,5 分鐘後,成品就在你的桌面。這就是 InAgent 所開啟的未來。

Pro Tip 專家見解: 接下來的爆發點將在「垂直領域 Agent」。當通用操作能力達到 90% 後,針對醫療、金融、法律等高門檻軟體的專用 Agent 將帶來數兆美元的生產力釋放。

這將會對 SaaS 產業產生毀滅性打擊。如果 AI 能直接操作 UI,那麼很多為了優化用戶體驗而設計的複雜界面將變得毫無意義。未來的軟體設計可能會演變成兩種極端:一種是給 AI 讀的「純數據接口」,另一種是極簡的「人類監督界面」。

當 AI 拿到你的滑鼠權限,我們該擔心什麼?

雖然 90.2% 的成功率很爽,但這也開啟了潘朵拉的盒子。當 AI 可以操作你的所有權限時,一旦遭受「提示詞注入攻擊」(Prompt Injection),駭客可能只需要發一封郵件給你的 AI Agent,然後 AI 就會乖乖幫駭客把你的所有銀行帳戶資金轉走,或者在你的系統後台植入木馬。

此外,隱私問題也被推到了極致。AI 必須不斷截圖、記錄屏幕內容才能操作,這意味著你在電腦上做的一切都被實時監控並傳輸到雲端推理。如果缺乏強大的端側(On-device)加密技術,這簡直就是最完美的間諜軟件。

常見問題 (FAQ)

Q1: InAgent 與普通的自動化工具(如 RPA)有什麼區別?

傳統 RPA 依賴死板的腳本(如果 A 發生就做 B),一旦界面變了就失效。而 InAgent 具備視覺感知和推理能力,它能理解界面元素的意思,即使按鈕位置移動了,它依然能找到並正確操作。

Q2: 為什麼 90% 被視為 Computer-Use Agent 的關鍵臨界點?

因為在真實生產環境中,低於 90% 的成功率意味著人類必須頻繁干預(每 10 次就要救一次場),這會導致管理成本高於自動化收益。突破 90% 才具備真正的商業落地價值。

Q3: 我現在可以使用 InAgent 嗎?

目前 InAgent 主要在研究和 B 端測試階段。建議關注 OSWorld 相關開源項目或ติดตาม实在智能的官方發布,以獲取最新的部署指南。

準備好讓 AI 接管你的重複工作了嗎?

不要等競爭對手全部數位化後才開始行動。現在就聯繫我們,定制你的 AI Agent 導入方案!

立即預約 AI 自動化諮詢

Share this content: