大語(yǔ)言模型擴(kuò)展了人的腦力,傳統(tǒng)機(jī)器人擴(kuò)展了人的體力,而具身智能試圖把兩者連接起來(lái):讓機(jī)器既能理解任務(wù),也能在真實(shí)環(huán)境中采取行動(dòng),并從行動(dòng)結(jié)果中繼續(xù)學(xué)習(xí)。但是,這件事的難點(diǎn)遠(yuǎn)不只是給大模型接上一條機(jī)械臂。語(yǔ)言模型處理的是符號(hào)和知識(shí),機(jī)器人面對(duì)的卻是空間、接觸、摩擦、遮擋、形變和不確定性。一個(gè)真正可用的具身基礎(chǔ)模型,需要把感知、預(yù)測(cè)、決策和動(dòng)作放進(jìn)同一個(gè)物理閉環(huán)中。從這個(gè)角度看,具身智能的核心問(wèn)題可以概括為一句話:模型怎樣把對(duì)世界的理解,轉(zhuǎn)化為真實(shí)、穩(wěn)定、可泛化的動(dòng)作?本文根據(jù)WAIC 2026 智啟具身論壇上清華大學(xué)計(jì)算機(jī)系副研究員 蘇航的《從觀察到行動(dòng):具身智能的基礎(chǔ)模型與反饋學(xué)習(xí)》演講內(nèi)容整理相關(guān)信息,幫助大家理解當(dāng)前熱門的物理AI上談的具身智能基礎(chǔ)模型,他是什么?能做什么?未來(lái)的發(fā)展。
一、身體不是執(zhí)行器,而是智能與世界之間的接口
如果智能沒(méi)有身體,它就只能在數(shù)字世界中觀察、分析和生成信息。身體讓智能擁有了另一種學(xué)習(xí)方式:通過(guò)動(dòng)作影響環(huán)境,再?gòu)沫h(huán)境反饋中理解物理規(guī)律。人類并不是先掌握一套完整的物理方程,再學(xué)會(huì)擰螺絲、拉拉鏈或炒菜。我們?cè)诓粩嗟膰L試中形成手眼協(xié)調(diào)、接觸判斷和動(dòng)作經(jīng)驗(yàn)。身體既是行動(dòng)工具,也是感知與學(xué)習(xí)系統(tǒng)的一部分。因此,具身智能不是“大腦負(fù)責(zé)思考,身體只負(fù)責(zé)執(zhí)行”的簡(jiǎn)單組合。它更像一個(gè)連續(xù)閉環(huán):感知環(huán)境 → 理解任務(wù) → 預(yù)測(cè)后果 → 生成動(dòng)作 → 接收反饋 → 更新能力
這條閉環(huán)也是具身智能通向更通用智能的重要路徑。模型只有真正進(jìn)入物理世界,才能學(xué)習(xí)那些無(wú)法僅靠語(yǔ)言和圖像完整描述的經(jīng)驗(yàn)。二、具身智能需要自己的原生基礎(chǔ)模型
VLA、世界模型等技術(shù)都受益于語(yǔ)言模型和多模態(tài)模型的發(fā)展,但具身基礎(chǔ)模型不能只是現(xiàn)有大模型的簡(jiǎn)單延伸。原因很直接:大量物理技能很難被語(yǔ)言完整表達(dá)。比如擰緊一顆螺絲時(shí),手需要實(shí)時(shí)感知阻力;拉拉鏈時(shí),需要協(xié)調(diào)方向、張力和速度;炒菜時(shí),需要根據(jù)食材狀態(tài)連續(xù)調(diào)整動(dòng)作。這些能力包含大量隱性的時(shí)空和接觸經(jīng)驗(yàn)。一個(gè)面向真實(shí)世界的具身基礎(chǔ)模型,至少需要具備三類核心能力:- 泛化能力:面對(duì)新物體、新環(huán)境、新任務(wù)甚至新機(jī)器人本體,仍能遷移已有經(jīng)驗(yàn);
- 魯棒性:環(huán)境發(fā)生擾動(dòng)、動(dòng)作出現(xiàn)偏差時(shí),仍能穩(wěn)定完成任務(wù)或恢復(fù);
- 數(shù)據(jù)遷移能力:能夠聯(lián)合利用機(jī)器人數(shù)據(jù)、人類操作數(shù)據(jù)、互聯(lián)網(wǎng)視頻和仿真數(shù)據(jù)。
這三種能力決定了模型能否從“一個(gè)任務(wù)訓(xùn)練一個(gè)策略”,走向共享物理經(jīng)驗(yàn)的通用基礎(chǔ)模型。三、具身數(shù)據(jù)正在從遙操作走向無(wú)本體采集
傳統(tǒng)機(jī)器人數(shù)據(jù)通常來(lái)自遙操作:操作員控制一臺(tái)具體機(jī)器人完成任務(wù),系統(tǒng)記錄視覺、關(guān)節(jié)和動(dòng)作軌跡。這類數(shù)據(jù)與目標(biāo)機(jī)器人高度一致,質(zhì)量較高,但采集成本高,擴(kuò)展到大量家庭和工業(yè)場(chǎng)景非常困難。UMI類無(wú)本體采集提供了另一條路線。采集者可以帶著輕量設(shè)備進(jìn)入真實(shí)環(huán)境,直接記錄人類操作過(guò)程,不必把整臺(tái)機(jī)器人搬到現(xiàn)場(chǎng)。數(shù)據(jù)采集因此與特定機(jī)器人本體解耦,更容易擴(kuò)大場(chǎng)景、任務(wù)和物體的多樣性。但“采回來(lái)”不等于“能訓(xùn)練”。人類數(shù)據(jù)與機(jī)器人數(shù)據(jù)之間至少存在三類差異:1. 觀察視角不同:人通常以更高、更靈活的視角觀察,機(jī)器人的攝像頭位置和視野不同;2. 身體結(jié)構(gòu)不同:人手、夾爪、機(jī)械臂和靈巧手的自由度與運(yùn)動(dòng)約束不同;3. 動(dòng)作空間不同:人類可行的動(dòng)作,并不一定能被機(jī)器人直接執(zhí)行。所以,無(wú)本體數(shù)據(jù)利用的關(guān)鍵不是簡(jiǎn)單復(fù)制人的軌跡,而是學(xué)習(xí)一種跨本體的動(dòng)作表征:從人類動(dòng)作中提取與具體身體無(wú)關(guān)的任務(wù)意圖、空間關(guān)系和運(yùn)動(dòng)結(jié)構(gòu),再把它映射到目標(biāo)機(jī)器人的可執(zhí)行空間。四、跨本體學(xué)習(xí)的關(guān)鍵,是建立統(tǒng)一的動(dòng)作表征
面對(duì)不同機(jī)器人本體,直接對(duì)齊關(guān)節(jié)角幾乎不可行。雙臂機(jī)器人、單臂機(jī)械臂、夾爪和靈巧手擁有不同的自由度,同一個(gè)“把杯子放進(jìn)柜子”的任務(wù),在各自系統(tǒng)中的底層動(dòng)作完全不同。更可擴(kuò)展的思路,是把動(dòng)作映射到一個(gè)共享的隱空間。在這個(gè)空間里,模型不直接記憶某臺(tái)機(jī)器人的關(guān)節(jié)運(yùn)動(dòng),而是學(xué)習(xí)更抽象的動(dòng)作單元和物理關(guān)系,例如:接近目標(biāo)、建立抓取、保持約束、沿路徑移動(dòng)、釋放物體。訓(xùn)練時(shí),可以利用離散化或量化機(jī)制,把連續(xù)且高度異構(gòu)的動(dòng)作壓縮為可學(xué)習(xí)的動(dòng)作表征。不同機(jī)器人、人類操作設(shè)備和任務(wù)數(shù)據(jù),因而能夠進(jìn)入同一訓(xùn)練框架。這種統(tǒng)一表征追求的不是讓所有本體執(zhí)行完全相同的軌跡,而是讓它們共享相同的任務(wù)結(jié)構(gòu)和物理經(jīng)驗(yàn)。其價(jià)值最終體現(xiàn)在零樣本遷移上:模型面對(duì)未見過(guò)的本體、環(huán)境、物體或任務(wù)結(jié)構(gòu)時(shí),仍能利用過(guò)去學(xué)到的知識(shí)完成操作。五、視頻數(shù)據(jù)提供規(guī)模,機(jī)器人數(shù)據(jù)完成物理對(duì)齊
視頻是成本最低、來(lái)源最廣的數(shù)據(jù)形式之一。互聯(lián)網(wǎng)和第一視角視頻包含大量人類行為、物體變化和場(chǎng)景演化信息,可以幫助模型學(xué)習(xí)“世界如何變化”。視頻生成模型之所以受到具身智能關(guān)注,是因?yàn)樗陬A(yù)測(cè)后續(xù)畫面的過(guò)程中,會(huì)學(xué)習(xí)一部分時(shí)序關(guān)系和物理先驗(yàn):物體如何移動(dòng)、接觸后可能發(fā)生什么、一個(gè)動(dòng)作如何改變環(huán)境狀態(tài)。但視頻只有觀察,沒(méi)有天然的機(jī)器人動(dòng)作標(biāo)簽。它可以告訴模型“接下來(lái)發(fā)生了什么”,卻不一定能直接告訴機(jī)器人“關(guān)節(jié)應(yīng)該怎么動(dòng)”。因此,不同數(shù)據(jù)承擔(dān)著不同職責(zé):- 互聯(lián)網(wǎng)視頻提供大規(guī)模場(chǎng)景、物體和行為知識(shí);
- 第一視角與UMI數(shù)據(jù)提供人類操作軌跡和任務(wù)結(jié)構(gòu);
- 機(jī)器人數(shù)據(jù)提供可執(zhí)行動(dòng)作和本體約束;
- 仿真數(shù)據(jù)補(bǔ)充可控試錯(cuò)和長(zhǎng)尾狀態(tài);
- 真實(shí)部署數(shù)據(jù)提供最終環(huán)境中的失敗與恢復(fù)經(jīng)驗(yàn)。
具身數(shù)據(jù)沒(méi)有一種“萬(wàn)能來(lái)源”。真正有效的基礎(chǔ)模型,需要把不同數(shù)據(jù)的優(yōu)勢(shì)組合起來(lái)。六、VLA、世界模型、VGM和IDM可以放進(jìn)統(tǒng)一框架
- VLA學(xué)習(xí)從視覺和語(yǔ)言指令到動(dòng)作的映射;
- 世界模型預(yù)測(cè)動(dòng)作執(zhí)行后環(huán)境會(huì)怎樣變化;
- 視頻生成模型(VGM)學(xué)習(xí)視覺世界的時(shí)序演化;
- 逆動(dòng)力學(xué)模型(IDM)根據(jù)狀態(tài)變化反推動(dòng)作。
這些模型看起來(lái)解決不同問(wèn)題,但本質(zhì)上都在對(duì)條件概率進(jìn)行建模:給定一部分信息,預(yù)測(cè)另一部分信息。例如,VLA根據(jù)當(dāng)前觀察和任務(wù)指令預(yù)測(cè)動(dòng)作;世界模型根據(jù)當(dāng)前狀態(tài)和動(dòng)作預(yù)測(cè)未來(lái);IDM根據(jù)當(dāng)前狀態(tài)和目標(biāo)狀態(tài)推斷中間動(dòng)作。既然它們共享類似的概率建模基礎(chǔ),就有機(jī)會(huì)在統(tǒng)一架構(gòu)中聯(lián)合訓(xùn)練。統(tǒng)一建模帶來(lái)兩項(xiàng)重要收益。第一,不同來(lái)源的數(shù)據(jù)可以互相增強(qiáng)。沒(méi)有動(dòng)作標(biāo)簽的視頻也可以幫助模型學(xué)習(xí)世界變化,機(jī)器人數(shù)據(jù)則負(fù)責(zé)把這種理解對(duì)齊到可執(zhí)行動(dòng)作。第二,多任務(wù)后訓(xùn)練不容易破壞模型原有能力。傳統(tǒng)VLA在適配新任務(wù)時(shí),可能出現(xiàn)災(zāi)難性遺忘或能力退化;如果模型擁有更廣泛的世界表征和多類型數(shù)據(jù)基座,新增任務(wù)更可能成為能力擴(kuò)展,而不是對(duì)舊能力的覆蓋。七、模型進(jìn)化最有價(jià)值的數(shù)據(jù),往往來(lái)自能力邊界
預(yù)訓(xùn)練數(shù)據(jù)通常由成功演示構(gòu)成,它告訴模型“正確動(dòng)作應(yīng)該是什么”。但機(jī)器人進(jìn)入真實(shí)環(huán)境后,最有價(jià)值的樣本往往不是那些已經(jīng)能穩(wěn)定完成的任務(wù),而是處在成功與失敗邊界上的狀態(tài)。比如機(jī)器人準(zhǔn)備拿起桌邊的水瓶。正常策略可能直接抓取,但更穩(wěn)妥的做法是先把水瓶向桌內(nèi)推,再完成抓取。這樣的邊界狀態(tài)很難在標(biāo)準(zhǔn)演示數(shù)據(jù)中被系統(tǒng)覆蓋,卻決定了機(jī)器人在真實(shí)環(huán)境中的可靠性。- 環(huán)境發(fā)生訓(xùn)練時(shí)未見的擾動(dòng);
- 任務(wù)可以恢復(fù),但模型不知道如何恢復(fù);
這些數(shù)據(jù)直接暴露了模型當(dāng)前的能力邊界。只要能夠把它們收集并轉(zhuǎn)化為訓(xùn)練信號(hào),模型就能有針對(duì)性地?cái)U(kuò)大成功區(qū)域。八、人類接管不是補(bǔ)丁,而是一種高價(jià)值訓(xùn)練機(jī)制
當(dāng)機(jī)器人偏離正確軌跡時(shí),人類可以短暫接管,把系統(tǒng)從失敗邊緣拉回成功路徑。這個(gè)過(guò)程通常被稱為human-in-the-loop。傳統(tǒng)觀點(diǎn)容易把人工接管視為自動(dòng)化不完善的補(bǔ)丁。但從學(xué)習(xí)角度看,接管數(shù)據(jù)具有很高價(jià)值:它精確發(fā)生在模型最需要幫助的位置,包含從錯(cuò)誤狀態(tài)恢復(fù)到正確狀態(tài)的路徑。一個(gè)有效的人類接管閉環(huán)可以分為四步:1. 系統(tǒng)識(shí)別策略偏離或低置信狀態(tài);2. 人類在關(guān)鍵時(shí)刻接管并糾正動(dòng)作;3. 系統(tǒng)記錄偏離前、接管中和恢復(fù)后的完整軌跡;4. 模型利用這些數(shù)據(jù)學(xué)習(xí)恢復(fù)策略,擴(kuò)大自主成功范圍。相比繼續(xù)收集大量重復(fù)的成功數(shù)據(jù),邊界接管數(shù)據(jù)往往擁有更高的信息密度。它可以減少工程團(tuán)隊(duì)為最后10%的長(zhǎng)尾問(wèn)題投入的大量調(diào)試時(shí)間。更重要的是,人類接管不是永久依賴。每一次接管都應(yīng)該成為下一輪訓(xùn)練數(shù)據(jù),讓類似問(wèn)題在未來(lái)逐漸轉(zhuǎn)為自主處理。九、具身基礎(chǔ)模型的完整學(xué)習(xí)閉環(huán)
把上述方法放在一起,可以得到一條從數(shù)據(jù)到能力的完整路徑:多源數(shù)據(jù)采集 → 跨本體動(dòng)作表征 → 統(tǒng)一概率建模 → 多任務(wù)預(yù)訓(xùn)練 → 真實(shí)部署 → 邊界狀態(tài)識(shí)別 → 人類接管 → 恢復(fù)數(shù)據(jù)回流 → 模型更新
這里最重要的變化,是訓(xùn)練不再止于模型發(fā)布。部署本身成為持續(xù)學(xué)習(xí)的一部分:機(jī)器人在真實(shí)環(huán)境中執(zhí)行任務(wù),發(fā)現(xiàn)預(yù)訓(xùn)練沒(méi)有覆蓋的狀態(tài),再通過(guò)人工接管、失敗恢復(fù)和數(shù)據(jù)回流不斷擴(kuò)展能力。因此,具身基礎(chǔ)模型的競(jìng)爭(zhēng)不會(huì)只取決于模型參數(shù)量,也取決于三個(gè)系統(tǒng)能力:- 能否把異構(gòu)數(shù)據(jù)映射到統(tǒng)一的物理表征;
- 能否在真實(shí)部署中持續(xù)回收邊界數(shù)據(jù)并快速更新模型。
結(jié)語(yǔ):真正的通用能力,來(lái)自持續(xù)進(jìn)入未知
具身智能并不是讓機(jī)器人記住更多標(biāo)準(zhǔn)動(dòng)作,而是讓它能夠處理越來(lái)越多未見過(guò)的物體、環(huán)境、本體和異常狀態(tài)。視頻和無(wú)本體數(shù)據(jù)解決規(guī)模問(wèn)題,機(jī)器人數(shù)據(jù)解決動(dòng)作對(duì)齊問(wèn)題,統(tǒng)一模型解決多任務(wù)共享問(wèn)題,真實(shí)部署和人類接管則解決邊界擴(kuò)展問(wèn)題。最終,一個(gè)成熟的具身基礎(chǔ)模型應(yīng)該形成這樣的能力:看得懂環(huán)境,理解人的意圖,預(yù)測(cè)行動(dòng)后果,生成可執(zhí)行動(dòng)作,在出現(xiàn)偏差時(shí)恢復(fù),并把每一次失敗轉(zhuǎn)化為下一次成功的經(jīng)驗(yàn)。從感知到動(dòng)作執(zhí)行,真正連接兩端的不是某一個(gè)模型模塊,而是一套不斷與物理世界交互、不斷修正自身的數(shù)據(jù)與學(xué)習(xí)閉環(huán)。*未經(jīng)準(zhǔn)許嚴(yán)禁轉(zhuǎn)載和摘錄-獲取本文參考資料方式:加入我們的知識(shí)星球可以下載公眾號(hào)海量參考資料包含以上參考資料。WAIC 2026 圓桌討論 - 從虛擬到現(xiàn)實(shí):世界模型如何驅(qū)動(dòng)具身智能
1020家展商擠爆上海:從WAIC 2026參展名錄,讀懂中國(guó)AI的下一個(gè)風(fēng)口
世界模型 101:概念、技術(shù)爭(zhēng)鳴與科學(xué)應(yīng)用
世界模型 102:三條技術(shù)路線與大一統(tǒng)趨勢(shì)的架構(gòu)解讀
每賣一輛問(wèn)界,13.6萬(wàn)流向華為:賽力斯的康柏時(shí)刻
從福布斯的李柯訪談看比亞迪:產(chǎn)品技術(shù)和出海戰(zhàn)略
大眾汽車集團(tuán)的精簡(jiǎn)一半車型,將在中國(guó)和歐洲削減100萬(wàn)輛產(chǎn)能未來(lái)計(jì)劃
特斯拉2026 Q2 銷量增長(zhǎng)25%的背后深度分析
Waymo世界模型在CVPR 2026上首次曝光:自動(dòng)駕駛正在進(jìn)入“Genie時(shí)代”
特斯拉 CVPR 2026 演講全文和詳解:把自動(dòng)駕駛,做成「所有機(jī)器人的基礎(chǔ)模型」