過去幾年,生成式AI的突破讓人們看到了一條清晰的技術路徑:更多數據、更大模型和更多算力,可以不斷拓展數字智能的能力邊界。但當AI從語言、圖像和代碼走進真實世界,這套邏輯是不是能被原樣復制?其實,物理AI面對的不是一個封閉、可隨時重置的數字環境。機器人必須感知空間、理解任務、規劃動作、控制身體,還要應對摩擦、遮擋、形變、擾動和意外失敗。一次錯誤,在數字世界里可能只是重新生成一次答案;在物理世界里,卻可能意味著零部件損壞、生產中斷,甚至安全事故。因此,物理AI真正要解決的問題,不只是“模型能不能做出一個演示”,而是機器人能否在不同任務、不同場景和不同本體上穩定工作,并且從每一次真實交互中繼續學習。本文通過WAIC 2026 智啟具身論壇上智元合伙人、高級副總裁、具身業務部總裁,覓蜂科技董事長兼CEO 姚卯青的《模型與數據飛輪:沖破物理墻,驅動物理AI的智能涌現》演講內容整理相關信息,幫助大家理解當前熱門的物理AI真正的門檻:不是算法模型,而是系統工程。1. 理解物理AI,要先理解智能的兩條主線
表征,是對世界進行抽象和壓縮。語言、數學、代碼,本質上都是人類對世界形成的高密度表征。大語言模型的成功,很大程度上來自對海量知識表征的學習。感知環境 → 理解任務 → 作出決策 → 執行動作 → 獲得反饋 → 修正策略
數字AI已經在“知識表征”和數字環境內的反饋閉環中取得了巨大進展。但物理AI不僅要理解知識,還要形成對真實交互經驗的表征,并在現實環境中完成閉環。這意味著,物理AI不是數字AI能力的簡單延伸,而是一種范式變化:從知識的規模化,走向真實世界交互經驗的規模化。互聯網可以直接為語言模型提供文本、圖像和視頻,但互聯網上沒有現成的機器人操作軌跡、力反饋、失敗恢復過程和精密控制經驗。物理AI必須在真實世界中“摸爬滾打”,通過行動積累經驗,再用經驗修正策略。2. 物理AI規模化之前,必須翻過三道墻
1. 數據墻:真實交互數據既稀缺又昂貴
網頁數據可以被大規模抓取,機器人數據卻很難被“爬”出來。一次高質量真機數據采集,需要機器人本體、傳感器、操作人員、任務環境和安全保障共同參與。而且,物理數據不是一段普通視頻。真正可用于訓練的數據,往往還需要包含:數據采集成本高、標準不統一、質量參差不齊,供給和模型需求之間還存在明顯錯配。這構成了物理AI的第一道墻。2. 表征墻:不同任務、場景和本體之間難以共享經驗
今天的不少機器人系統仍然圍繞單一任務訓練:一個模型負責疊衣服,另一個模型負責分揀;換一臺機械臂、換一個房間或換一種物體,模型往往就要重新適配。物理AI需要學習的不是某一個動作的表面軌跡,而是動作背后的通用物理經驗。例如:什么是抓取穩定性、怎樣處理遮擋、物體發生形變后應該如何調整、任務失敗后怎樣恢復。只有形成跨任務、跨場景、跨本體的統一表征,數據才可能被復用,模型能力才可能真正泛化。3. 閉環墻:真實世界試錯代價太高
強化學習在仿真或游戲環境中可以進行海量試錯,因為環境可以快速重置,失敗幾乎沒有成本。但機器人在真實世界中的反饋速度慢、并行難度高,一次失敗還可能造成硬件損壞。因此,物理AI不能只依靠“讓機器人自己多試幾次”。它需要同時借助真機環境、物理仿真和神經網絡世界模型,構建可驗證、可并行、可擴展的閉環訓練環境。3. 一個通用物理AI系統,需要具備三種能力
跨越三道墻之后,目標不是訓練一個會做更多動作的機器人,而是構建一個可泛化、可優化、可進化的系統。可泛化,指機器人能夠從大規模、多來源的數據中學習通用物理經驗,并將能力遷移到新任務、新場景和新本體。可優化,指機器人可以在真實任務中接受反饋,通過后訓練不斷校正策略,提升成功率、穩定性和可靠性。可進化,則意味著機器人部署后產生的數據能夠回流到訓練系統,使模型持續吸收新的任務和環境經驗,不斷拓展能力邊界。對應到工程體系,一套完整的物理AI系統至少包含四層:這四層不是各自獨立的模塊,而是一套不斷轉動的系統。4. 模型路線正在從“直接出動作”轉向“先想后做”
目前物理AI的模型演進,大致可以看到兩條互補路線。第一條是VLA,即視覺—語言—動作模型。它擅長理解環境和語言指令,完成任務語義對齊,并形成較高層級的動作規劃。簡單來說,VLA回答的是:我在哪里?要完成什么任務?大致應該怎么做?
第二條是WAM,即世界動作模型。它更關注動力學和未來狀態的推演,回答的是:如果執行這個動作,接下來會發生什么?
傳統策略模型經常從目標直接輸出動作,類似一種“肌肉記憶”。這種方式在固定任務中可以有效,但面對長程任務、環境擾動和意外狀態時,容易缺少可解釋的中間規劃。新的方向是讓機器人“先想后做”:先生成較低頻、較粗粒度的任務規劃,再由高頻控制系統完成精細動作。高層系統負責理解、拆解和規劃,低層系統負責實時跟隨和穩定控制。從長期看,VLA與WAM不是非此即彼。更可能出現的終局,是把VLA的語義理解和規劃能力,與世界模型的物理推演能力融合起來,形成世界推理動作模型:理解任務 → 推演未來 → 評估選擇 → 執行動作
這時,機器人就不再只是把感知信號映射為電機動作,而是具備了對行動后果進行預測和選擇的能力。5. 世界模型的價值,不只是生成視頻
世界模型常被理解為“預測下一幀畫面”,但對物理AI來說,僅能生成未來視頻遠遠不夠。如果世界模型能夠接收初始畫面、任務指令和機器人動作,并快速推演環境如何變化,就可以在不反復消耗真機的情況下評估策略、生成訓練反饋、篩選失敗案例。它的意義并不是替代真實世界,而是承擔那些成本高、風險大、需要大量并行試驗的訓練環節。真機提供最高保真的經驗,仿真提供可控的物理環境,神經網絡世界模型提供高速的狀態推演,三者共同組成物理AI的訓練閉環。6. 預訓練決定起點,后訓練決定能否干活
預訓練讓模型獲得通用認知、基礎動作能力和跨任務遷移能力,但一個模型在基準測試中表現優秀,并不代表它能直接進入工廠或家庭。真實部署要求的往往不是“偶爾成功”,而是長時間、無人干預、高一致性地運行。在這種標準下,后訓練的重要性會迅速上升。一種可擴展的做法,是讓機器人集群在真實環境中運行,并實時回傳:云端系統據此更新策略,再把新模型下發到機器人集群。隨著機器人數量增加,原本串行、低頻的真機學習過程,可以轉變為并行的群體學習過程。這里真正值得關注的,不只是“有多少臺機器人一起訓練”,而是能否建立一套秒級接入、統一調度、快速更新、可追蹤評估的云—邊—端協同系統。只有這樣,真機強化學習才可能從單機實驗走向規模化工程。7. 物理AI需要的是數據金字塔,而不是一種“萬能數據”
真機數據質量最高,卻最昂貴。互聯網數據規模最大,卻缺少直接的機器人動作和接觸信息。因此,物理AI的數據體系不會只依賴一種數據,而更像一座金字塔。最底層是海量互聯網數據,用于學習常識、物體語義、場景關系和人類行為知識。中間層是第一視角和UMI(universal manipulate interface)類無本體數據。它們可以記錄人類操作過程、空間軌跡、時序關系,部分設備還可以采集力反饋。相比真機遙操作,這類數據更容易進入家庭、工廠和服務場景,適合擴大任務與環境的多樣性。最上層是真機數據,包括高精度動作軌跡、機器人狀態、接觸信息、失敗恢復數據和部署回流數據。它規模較小,卻最接近最終執行分布,是模型完成物理對齊和高可靠后訓練的關鍵。真正有效的“數據配方”,不是在不同數據類型中三選一,而是根據任務階段組合它們:8. 采集只是第一步,數據治理決定數據能否轉化為能力
原始操作視頻并不能直接成為高質量訓練數據。物理AI的數據治理至少需要完成以下流程:其中最容易被忽略的是最后一步:數據不能只被打上“好”或“不好”的標簽,還要能夠回答“哪批數據讓哪個任務提升了多少”“問題來自數據覆蓋不足,還是動作質量不夠”“下一輪應該補采什么”。當數據質量、模型效果和具體任務之間建立可追蹤關系后,采集才不再是盲目堆量,而會變成一套可以計算投入產出比的工程過程。9. 真正的飛輪,發生在機器人部署之后
模型執行 → 數據回流 → 失敗與高價值樣本挖掘 → 模型更新 → OTA下發 → 再次執行
預訓練解決的是模型“從哪里出發”,部署回流決定的是模型“最終能走多遠”。因為真實場景會不斷產生訓練階段沒有覆蓋的長尾問題:物體擺放發生變化、光線改變、夾取位置偏移、材料出現形變、設備逐漸磨損,或者任務流程臨時調整。這些邊界數據恰恰最有價值,因為它們直接暴露了模型當前的能力邊界。當系統能夠自動發現失敗、定位原因、回收數據并更新模型時,機器人部署就不再只是能力的終點,也會成為下一輪訓練的起點。結語:模型決定起點,系統工程托底下限,數據定義終局
不過,物理AI落地,最終要看穩定性而不是演示效果,演示視頻證明的是“機器人曾經成功過”的是由單點能力決定的演示上限,產業部署要求的卻是“機器人能否持續成功”,而他需要的是系統能力決定部署下限,需要預訓練、后訓練、真機強化學習、仿真、數據閉環、多模態感知、精密力控和云邊端協同的共同作用。
所以,物理AI的“智能涌現”不會只由更大的模型帶來。它取決于模型、數據、世界模型、仿真、真機訓練、部署場景和硬件系統能否形成一套持續進化的閉環。模型決定機器人一開始具備怎樣的通用能力;數據決定它能夠理解多少真實世界的變化;后訓練決定它能不能把任務做好;部署回流決定它是否可以越來越好。總結起來,物理AI真正的競爭,不只是比誰的機器人更像人、演示更驚艷,而是比誰能更早建立一套可泛化、可優化、可進化的系統。當數據墻、表征墻和閉環墻被逐步打通,機器人才能真正從“會表演”走向“能干活”,并最終形成屬于物理世界的智能飛輪。
*未經準許嚴禁轉載和摘錄-獲取本文參考資料方式:加入我們的知識星球可以下載公眾號海量參考資料包含以上參考資料。WAIC 2026 圓桌討論 - 從虛擬到現實:世界模型如何驅動具身智能
1020家展商擠爆上海:從WAIC 2026參展名錄,讀懂中國AI的下一個風口
世界模型 101:概念、技術爭鳴與科學應用
世界模型 102:三條技術路線與大一統趨勢的架構解讀
每賣一輛問界,13.6萬流向華為:賽力斯的康柏時刻
從福布斯的李柯訪談看比亞迪:產品技術和出海戰略
大眾汽車集團的精簡一半車型,將在中國和歐洲削減100萬輛產能未來計劃
特斯拉2026 Q2 銷量增長25%的背后深度分析
Waymo世界模型在CVPR 2026上首次曝光:自動駕駛正在進入“Genie時代”
特斯拉 CVPR 2026 演講全文和詳解:把自動駕駛,做成「所有機器人的基礎模型」