AGIBOT WITA-Omni 榜單登頂是這篇文章討論的核心

「一家做機器人的公司,居然在音視訊推理榜單上,把 Google、阿里巴巴、字節跳動全數掀翻?」看到 Daily-Omni 最新放榜的那一刻,這是我腦中冒出的第一句話。2026 年 7 月 28 日,智元機器人(AGIBOT)官方從上海甩出一記重拳:自家具身原生全模態大模型 WITA-Omni Preview,以平均正確率 85.21% 登頂,把千問、Gemini、豆包甚至輝達的 Omni 模型全踩在腳下。多模態大模型這條賽道,向來是科技巨頭的後花園,如今卻殺出一家「做機器人本體」的新創——這劇情,值得好好拆一拆。
快速精華:三分鐘看懂這件事
- 💡 核心結論:AGIBOT(智元機器人)自研的 WITA-Omni Preview,以 85.21% 平均正確率登頂 Daily-Omni 音視訊推理榜,成為具身智能多模態領域的新王者;這象徵「聽覺+視覺聯合推理」正式成為機器人模型的兵家必爭之地。
- 📊 關鍵數據:2026 年全球多模態 AI 市場約 28.3~38.5 億美元,預估以 30.6% 年複合成長率於 2030 年達 82.4 億美元,2034 年更上看 419.5 億美元(Fortune Business Insights);WITA-Omni 在八項指標中六項奪冠或並列第一。
- 🛠️ 行動指南:企業主可鎖定餐廳、物流、養老照護等率先導入具身機器人的場景;投資人緊盯「視聽聯合推理模型開源進度、機器人本體出貨量、多模態數據標註成本」三指標。
- ⚠️ 風險預警:榜單分數不等於量產成熟度;硬體良率、長尾場景泛化與數據成本,仍是具身智能從「能看能聽」走向「真能幹活」的最大變數。
AGIBOT 憑什麼擠進多模態第一梯隊?拆解這家「機器人公司」的硬底子
先講清楚 AGIBOT 是誰。2023 年 2 月,前華為「天才少年」彭志輝(網名稚暉君)與鄧泰華在上海創立智元機器人,總部位於上海,專攻通用人形機器人。彭志輝在 B 站以硬核 DIY 聞名,是名副其實的「理工男頂流」;這家公司從誕生那天起,路線就跟純軟體 AI 公司截然不同——他們要的是「能走路、能幹活、能看能聽」的實體智能。
WITA-Omni Preview 正是這條路線的「大腦」:一個為具身交互(embodied interaction)而生的多模態基礎模型。這裡有個關鍵問題:為什麼機器人公司要自研大模型?答案很殘酷——市面上的通用模型是給「坐在電腦前的人」設計的,而機器人活在一個會動、會響、會變的物理世界。AGIBOT 的算盤是:軟體(模型)、硬體(本體)、數據(AGIBOT World 真實任務數據集)三條腿一起跑,這也正是它敢喊出「三智一體」的底氣。
85.21 分到底強在哪?WITA-Omni 在 Daily-Omni 的真實戰力
Daily-Omni 是什麼來頭?它是當前具身全模態理解領域的權威榜單,專門考驗模型對「真實世界音視訊」的聯合理解能力。這次 WITA-Omni Preview 以 85.21% 平均正確率登頂,最兇悍的地方在於:八項評測指標中,它在視聽對齊(audio-visual alignment)、比較推理(comparison)、事件排序(event sequencing)、30 秒與 60 秒長影片子集等六項拿下第一或並列第一,其中推理(inference)一項也與對手打成平手。
換句話說,它不是「某一科特別強」的偏科生,而是全科制霸。這背後是 AGIBOT 的三階段訓練法:先以監督式微調(SFT)打底,再用在線策略蒸餾(on-policy distillation)讓小模型向強模型看齊,最後以強化學習(RL)打磨決策能力——一套為物理世界時序理解量身打造的「特訓菜單」。下圖是這波浪潮背後的市場量級,肉眼可見的陡坡才剛開始。
音訊+視覺聯合推理,為何是具身智能的「分水嶺」而非加分項?
過去多模態模型的套路是「視覺歸視覺、聽覺歸聽覺」,各自為政;但真實世界從來不是單通道。廚房裡油鍋嘶嘶作響、馬路上喇叭聲由遠而近、產線上馬達聲突然變調——這些訊號單靠畫面根本讀不出來,必須視聽「聯動」才能推斷背後意涵。WITA-Omni 的登頂,等於向業界宣示:聯合音視訊理解(joint audio-visual reasoning)已成為機器人模型的必答題,不再是拿來展示的 Demo。
這對供應鏈的衝擊是即時的。感測器廠商開始重視麥克風陣列的時序精度,晶片廠商想把音訊 DSP 與視覺 NPU 塞進同一顆 SoC,數據標註公司則要接下「視聽對齊」這種高難度訂單。可以說,一個全新的細分賽道正在成形,而 AGIBOT 已經卡好身位。
2026 年多模態 AI 產業鏈將被如何改寫?從 28 億美元到百億美元級市場
把鏡頭拉遠,這場單點勝利背後是整條賽道的爆發。根據 The Business Research Company 最新報告,全球多模態 AI 市場 2026 年規模約 28.3 億美元,預估以 30.6% 的年複合成長率在 2030 年衝到 82.4 億美元;Mordor Intelligence 給出更樂觀的數字:2026 年 38.5 億美元、2031 年 135.1 億美元;Fortune Business Insights 甚至上看 2034 年達 419.5 億美元。
若把具身智能的「腦+身」想成一台複利機器:模型越強 → 機器人越能幹 → 任務數據越肥 → 模型再進化。AGIBOT 的 A2 人形機器人已創下「人形機器人最長行走距離」的金氏世界紀錄,並宣佈啟動通用機器人商業量產——WITA-Omni 的登頂,正好為這條量產之路補上最後一塊「大腦」拼圖。
2026 年之後,我們會看到什麼?具身模型從「能看」進化到「能懂」,服務型機器人開始進駐餐廳、醫院與家庭,工業場景從「重複搬運」升級為「自主決策」。這不是科幻片,而是供應鏈上正在發生的訂單、量產線與人才招聘。
FAQ:關於 WITA-Omni 與具身多模態,你該知道的 3 件事
Q1:WITA-Omni 跟 ChatGPT 這類聊天模型有什麼不同?
ChatGPT 這類模型主要在文字與靜態內容上推理,是給人坐在電腦前使用的「數位大腦」;WITA-Omni 則是為具身交互設計的「物理世界大腦」,必須即時融合麥克風捕捉的聲音與鏡頭捕捉的畫面,在動態環境中做時序推理,例如判斷「哪個方向傳來警報聲、接下來會發生什麼」。它追求的不是話說得好不好聽,而是行動對不對。
Q2:Daily-Omni 榜單的 85.21 分是什麼概念?
85.21% 是八項音視訊聯合理解指標的平均正確率,也是目前該榜單的最高分。它同時擊敗了阿里巴巴 Qwen3.5-Omni-Plus、Google Gemini 3.1 Pro Preview、字節跳動豆包 Seed 2.0 Lite 等主流模型,並在視聽對齊、事件排序、長影片子集等六項指標奪冠或並列第一。
Q3:這項技術多久會走進一般人的生活?
時程可能比你想的更快。AGIBOT 已啟動通用機器人商業量產,2026 年起服務型人形機器人會先出現在餐廳、物流倉儲與養老照護等場景;預估 3~5 年內,具備視聽聯合推理能力的家用機器人也會逐步落地,屆時「幫你聽門鈴、看爐火、提醒危險」將成為標配。
別只當觀眾:把觀察變成行動
無論你是想導入機器人方案的企業主、追蹤 AI 供應鏈的投資人,還是準備轉型的工程師,現在正是把「旁觀」變成「入場」的時刻。趨勢不會等人,供應鏈的洗牌也不會。歡迎與 siuleeboss.com 的團隊聊聊,我們陪你拆解數據、落地應用、卡位下一個十年。
參考資料與權威文獻
- AGIBOT 官方新聞稿(PRNewswire):AGIBOT’s WITA-Omni Preview Tops Daily-Omni Audio-Visual Reasoning Benchmark
- AgiBot 維基百科(公司背景):AgiBot – Wikipedia
- IT之家中文報導:智元 WITA-Omni Preview 具身大模型登頂 DailyOmni 全模態理解榜單
- The Business Research Company(市場規模):Multimodal AI Global Market Report 2026-2030
- Mordor Intelligence(市場規模):Multimodal AI Market Size & Growth Report 2031
- 首圖來源(Pexels):White Robot Action Figure on Blue String Lights
Share this content:













