機器人大腦的具身原生與大模型移植路線之爭 底層架構(gòu)、運行機理與訓練體系技術(shù)白皮書_第1頁
機器人大腦的具身原生與大模型移植路線之爭 底層架構(gòu)、運行機理與訓練體系技術(shù)白皮書_第2頁
機器人大腦的具身原生與大模型移植路線之爭 底層架構(gòu)、運行機理與訓練體系技術(shù)白皮書_第3頁
機器人大腦的具身原生與大模型移植路線之爭 底層架構(gòu)、運行機理與訓練體系技術(shù)白皮書_第4頁
機器人大腦的具身原生與大模型移植路線之爭 底層架構(gòu)、運行機理與訓練體系技術(shù)白皮書_第5頁
已閱讀5頁,還剩38頁未讀 繼續(xù)免費閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認領

文檔簡介

1《機器人大腦的具身原生與大模型移植路線之爭》報告版本:V2.0(深度重構(gòu)版)報告作者:北京力通通信·人類情感大模型項目負責人·白智興編制日期:2026年7月16日適用領域:具身智能、人形機器人、自動駕駛、工業(yè)自動化、數(shù)字孿生、物理AI“真正的智能必須建立在對世界運作方式的理解之上。”——YannLeCun,圖靈獎得主,Meta首席AI科學家“數(shù)字世界和物理世界的需求天然不一樣。數(shù)字世界希望畫質(zhì)高、有想象力、有創(chuàng)造性;但物理世界更重要的是快,是合理。”——沈宇軍,螞蟻靈波首席科學家“機器人的大腦,究竟應該沿著大模型的發(fā)展路徑繼續(xù)演進,還是應該圍繞物理世界重新構(gòu)建?最終取決于各硬件廠商產(chǎn)品設計前的三大抉擇→底層架構(gòu)、運行機理與訓練體系”2版權(quán)所有:力通通信作者微信:13——白智興·力通通信神經(jīng)網(wǎng)絡芯片項目組“世界模型的競爭,將從畫面質(zhì)量的競爭走向世界狀態(tài)與因果推演能力的競爭?!薄袠I(yè)共識,20262026年,具身智能產(chǎn)業(yè)迎來根本性的路線分野。一條路是“大模型移植”——依托現(xiàn)有數(shù)字世界大模型(LLM/VLM/視頻生成模型)的能力,通過微調(diào)、適配“嫁接”到機器人控制任務上。這條路起步快、門檻低,但存在結(jié)構(gòu)性錯位風險。另一條路是“具身原生”——從物理世界交互的原始需求出發(fā),在架構(gòu)層面原生內(nèi)嵌物理約束。這條路更難、更慢,但可能更正確。必須澄清一個關(guān)鍵誤解:“具身原生”不等于“必須從零訓練”。判斷標準是架構(gòu)是否原生服務于物理交互——基于可微分物理引擎的物理大模型(PFM)同樣是具身原生,因為它從架構(gòu)底層就將牛頓定律、碰撞約束等物理鐵律硬編碼為不可訓練的結(jié)構(gòu)。本文的核心貢獻在于:第一,嚴格界定基礎模型與應用架構(gòu)的概念層級。LLM、WFM、PFM屬于“基礎模型”層級——擁有獨立的預訓練主干與表征學習能力。VLA屬于“應用組合架構(gòu)”——由成熟組件拼接而成,無獨立預訓練主干。將四者并列對比是概念錯位,本文將其糾正為“三個基礎模型+一個應用架構(gòu)”的清晰框架。第二,揭示“具身原生”的完整光譜。從螞蟻靈波LingBot的自回歸從零預訓練,到物理大模型的可微分物理引擎內(nèi)置——它們共同構(gòu)成具身原生的完整光譜:一端是“數(shù)據(jù)原生”(從物理數(shù)據(jù)從零訓練一端是“架構(gòu)原生”(架構(gòu)內(nèi)置物理約束)。兩條子路徑的判別標準統(tǒng)一為:架構(gòu)是否原生服務于物理交互。第三,論證PFM作為路線融合的工程載體。行業(yè)共識“VLA負責決策,世界模型負責推演”——PFM正是這一共識的工程實現(xiàn)。它將WFM的視覺-時序能力與可微分物理引擎耦合,為VLA提供物理可信的“想象沙盒”。第四,基于2026年上半年最新產(chǎn)業(yè)數(shù)據(jù)與學術(shù)突破,呈現(xiàn)物理AI的市場格局、推理效率突破與訓練范式演進。版權(quán)所有:力通通信作者微信:133資本已經(jīng)用腳投票。2026年上半年,國內(nèi)具身智能賽道融資約438億元,其中超過一半流向了聚焦基礎模型、世界模型等智能層的“大腦派”公司。產(chǎn)業(yè)正從“本體競賽”全面走向“大腦競賽”。然而,更深層的問題在于:資本雖已按大腦的終局估值定價,行業(yè)卻連大腦的定義都尚未統(tǒng)一。螞蟻靈波首席科學家沈宇軍直言:“不用太糾結(jié)技術(shù)路線,現(xiàn)在整個具身大腦非常不成熟,要解決的問題還有很多。”本文以“具身原生”與“大模型移植”的根本分歧為主線,系統(tǒng)性梳理LLM、WFM、PFM三類基礎模型與VLA應用架構(gòu)的標準定義、底層架構(gòu)、運行機理與訓練體系,基于2026年上半年最新產(chǎn)業(yè)數(shù)據(jù)呈現(xiàn)物理AI的市場格局與推理效率突破,并給出模塊化場景選型方案。第一章兩條道路:從“嫁接”到“原生”當機器人公司開始打造“大腦”時,最自然的選擇是:已有的大模型能不能直接用?這一邏輯的誘惑力極強。LLM已能理解人類語言,VLM已能“看懂”圖像,視頻生成模型已能“想象”未來畫面——把這些能力組合起來,似乎就能構(gòu)成機器人的“大腦”。這正是“大模型移植”路線的核心邏輯:依托面向數(shù)字內(nèi)容創(chuàng)作的視頻生成模型或大語言模型,通過微調(diào)適配機器人控制任務。優(yōu)勢:起步快、成本低、有開源模型可用。螞蟻靈波CEO朱興坦言,數(shù)字世界的模型確實有想象力、有創(chuàng)造性——但問題恰恰出在這里。朱興的后半句話才是關(guān)鍵:“但物理世界需要的是快,是合理。”數(shù)字世界與物理世界對模型的底層需求存在根本性差異:需求維度數(shù)字世界物理世界需求維度數(shù)字世界物理世界畫質(zhì)要求越高越好夠用即可想象力想象力越豐富越好必須在物理可行域內(nèi)速度可容忍延遲硬實時(毫秒級)合理性語義合理即可物理合規(guī)不可妥協(xié)4當數(shù)字世界的模型設計之初就沒有考慮物理世界的需求時,強行微調(diào)會帶來兩個核心問題:“知識遺忘”:微調(diào)階段注入的機器人數(shù)據(jù)量遠小于互聯(lián)網(wǎng)預訓練數(shù)據(jù)量,模型傾向于“遺忘”微調(diào)中習得的物理適配能力,回退到預訓練階段的統(tǒng)計模式?!胺夯韵陆怠保涸陬A訓練數(shù)據(jù)覆蓋良好的場景表現(xiàn)尚可,一旦遇到訓練分布外的物理場景(新材質(zhì)、新幾何、新光照),性能急劇退化。螞蟻靈波首席科學家沈宇軍舉了一個內(nèi)部稱為“開門見貓”的例子,深刻揭示了兩條路線的底層邏輯分歧。一扇不透明的玻璃門后有一只貓。在數(shù)字世界的視覺理解中,貓在畫面中是清晰可見的。但對機器人而言,從物理空間感知的角度,那只貓“不應該存在”——因為玻璃門擋住了,機器人夠不到它。只有當門打開,貓才應該在機器人的“世界”中逐漸顯現(xiàn)。這個案例暴露出兩種模型在底層設計邏輯上的根本分歧:數(shù)字世界模型基于“視覺呈現(xiàn)”構(gòu)建世界——看得見,就存在物理世界模型基于“物理可達性”構(gòu)建世界——夠得著,才存在沈宇軍的結(jié)論清晰而堅定:“我們不認為機器人是數(shù)字世界大模型的一個物理Agent。數(shù)字世界很多模型在設計時,并沒有考慮物理世界的需求。”“具身原生”的核心理念是:架構(gòu)必須原生服務于物理交互,而非事后適配。這是一個判別標準,而非一條單一的技術(shù)路徑。必須澄清一個關(guān)鍵誤解:“具身原生”不等于“必須從零訓練”。版權(quán)所有:力通通信作者微信:135兩條子路徑:子路徑代表核心理念訓練數(shù)據(jù)數(shù)據(jù)原生螞蟻靈波從物理世界數(shù)據(jù)從零預訓練,自回歸架構(gòu)遵循物物理交互數(shù)據(jù)為LingBot理因果時序主架構(gòu)原生物理大模型架構(gòu)內(nèi)置可微分物理引擎,牛頓定律硬編碼為不仿真為主,真實可訓練的結(jié)構(gòu)統(tǒng)一判別標準:架構(gòu)是否原生服務于物理交互?物理先驗是否嵌入于模型結(jié)構(gòu)(而非僅依賴數(shù)據(jù)擬合)?基于這一標準,PFM同樣是具身原生——它將物理定律作為不可訓練的模型結(jié)構(gòu),從架構(gòu)底層保證輸出始終在物理可行域內(nèi)。這與LingBot“圍繞動態(tài)建模、因果預測、實時執(zhí)行原生設計”的理念完全一致,只是實現(xiàn)路徑不同:一個在數(shù)據(jù)中學習物理,一個在架構(gòu)中內(nèi)嵌物理。螞蟻靈波首次將具身原生理念系統(tǒng)落地于LingBot-VA2.0。其技術(shù)選擇具有標志性意義:放棄雙向視頻生成架構(gòu):視頻生成模型(如擴散模型)設計時即假設可雙向參考幀,但物理世界是單向因果的采用自回歸架構(gòu)從零預訓練:嚴格遵循物理世界單向因果時序從架構(gòu)到數(shù)據(jù)到訓練目標:第一天起就為機器人量身定制這一選擇并非易事。正如媒體所評價的,螞蟻靈波選擇了一條“更難的路”。但其支持者認為,這是從第一性原理出發(fā)的正確選擇——機器人的大腦,不能建立在為數(shù)字世界設計的模型之上。版權(quán)所有:力通通信作者微信:136物理大模型代表了具身原生的另一條子路徑:不在數(shù)據(jù)中從頭學習物理規(guī)律,而是將物理規(guī)律直接內(nèi)嵌于模型架構(gòu)。其核心架構(gòu)(詳見第二章2.4節(jié))包含三層:三維空間幾何表征系統(tǒng)(SGR將傳感信號轉(zhuǎn)化為精確的幾何參數(shù)可微分物理動力學規(guī)則庫(DPE):內(nèi)置全套物理微分方程,基礎方程永不訓練連續(xù)時序動態(tài)推演閉環(huán)(CTR):維持長時間推演的穩(wěn)定性PFM通過“物理狀態(tài)作為中間層”的架構(gòu)重構(gòu),將計算鏈路從“觀測→畫面預測”改寫為“觀測→物理狀態(tài)→物理演化→控制輸出”。每一步都有明確的物理語義,每一步都受物理定律約束。維度大模型移植路線具身原生路線起點已有LLM/VLM/視頻生成模型權(quán)重從物理交互需求出發(fā)架構(gòu)在現(xiàn)有模型上修修補補、微調(diào)適配架構(gòu)原生服務于物理交互數(shù)據(jù)互聯(lián)網(wǎng)文本+視頻為主,少量機器人物理交互數(shù)據(jù)(數(shù)據(jù)原生)或仿真數(shù)據(jù)(架構(gòu)原數(shù)據(jù)微調(diào)生)物理先驗無,完全依賴數(shù)據(jù)擬合訓練目標適配數(shù)字世界能力到物理任務圍繞動態(tài)建模、因果預測、實時執(zhí)行原生設計代表方案多數(shù)VLA方案、視頻生成模型微調(diào)路線(架構(gòu)原生)優(yōu)勢起步快、門檻低、有開源基礎無結(jié)構(gòu)性錯位、物理一致性高風險知識遺忘、泛化性下降、物理幻覺研發(fā)周期長、數(shù)據(jù)/引擎門檻高盡管路線分歧顯著,業(yè)界正在多個層面走向融合。小鵬汽車在CVPR2026上展示的技術(shù)圖譜中,第二代VLA與世界模型被定位為“雙支柱”——VLA從人類駕駛行為中學習“如何行動”,世界模型則通過對未來狀態(tài)的預測學習“行動之后世界會如何變化”,二者共同構(gòu)成物理世界基座模型。版權(quán)所有:力通通信作者微信:137小鵬通用智能中心負責人劉先明明確指出:世界模型與VLA不是互相替代或互相競爭的關(guān)系,而是通過不同訓練信號共同提升模型對物理世界的理解能力和在物理世界的行動能業(yè)界正在形成共識的分層架構(gòu)是:VLA負責“說人話、做決策”世界模型提供“內(nèi)嵌物理引擎”,提前模擬動作的物理后果,驗證計劃可行性這正是本報告PFM架構(gòu)的核心設計理念——PFM將WFM的視覺-時序能力與可微分物理引擎耦合,為VLA提供物理可信的“想象沙盒”。它是這一共識的工程實現(xiàn)。螞蟻靈波首席科學家沈宇軍的觀點務實而清醒:“不必太糾結(jié)是世界模型還是VLA,具身大腦要解決的問題還很多?!碑斍熬呱泶竽X整體仍非常不成熟——跨本體適配、數(shù)據(jù)飛輪、后訓練成本和商業(yè)化交付等多重門檻尚待跨越。在技術(shù)路線上過度糾結(jié),不如集中精力解決這些實質(zhì)性問題。兩條路線的分歧,最終指向一個更深層的問題:智能的本質(zhì)是什么?是處理符號的能力,還是理解世界運作方式的能力?如果智能=符號處理,那么大模型移植路線是合理的——把最強的符號處理器(LLM)嫁接到機器人上,問題就解決了。但如果智能=對世界運作方式的理解,那么移植路線從一開始就存在結(jié)構(gòu)性錯位——因為LLM從來就沒有真正“理解”過物理世界,它只是學會了描述世界的文本符號。物理世界的因果結(jié)構(gòu),不是靠更多的文本數(shù)據(jù)就能跨越的鴻溝。YannLeCun的論斷給出了方向:“真正的智能必須建立在對世界運作方式的理解之上?!本呱碓獰o論是數(shù)據(jù)原生還是架構(gòu)原生——正是通往這一目標的工程化路徑。兩者共同構(gòu)成一個完整的技術(shù)光譜:一端在數(shù)據(jù)中學習物理,一端在架構(gòu)中內(nèi)嵌物理。它們的判別標準統(tǒng)一而清晰:架構(gòu)是否原生服務于物理交互。版權(quán)所有:力通通信作者微信:138在深入技術(shù)細節(jié)之前,必須首先厘清一個根本性的概念問題:并非所有與機器人相關(guān)的AI模型都處于同一概念層級。本章將所涉及的四種技術(shù)方案分為兩個清晰的概念層級:概念層級包含方案判別標準基礎模型擁有獨立的預訓練主干與表征學習能力應用組合架構(gòu)VLA由成熟組件拼接而成,無獨立預訓練主干將VLA與LLM、WFM、PFM并列討論,如同將“汽車方向盤”與“發(fā)動機”、“變速箱”、“底盤”并列討論——概念層級不同。VLA本質(zhì)上是一個應用層的組合架構(gòu)方案:視覺編碼器(可復用WFM預訓練權(quán)重)+LLM語義模塊(復用LLM權(quán)重)+動作輸出頭(端到端微調(diào))。其核心貢獻在于多模態(tài)特征融合與動作映射,而非底層表征學習。本章將依次解析LLM、WFM、PFM三類基礎模型的底層架構(gòu),然后闡明VLA作為應用架構(gòu)的定位,最后給出系統(tǒng)性的對比與層級關(guān)系圖。LLM是面向人類主觀符號世界的一維時序基礎模型。其計算單元為離散文本Token,核心架構(gòu)為單一堆疊式Transformer,核心任務為自回歸下一詞預測。版權(quán)所有:力通通信作者微信:1392.2.2根本局限:五個“沒有”架構(gòu)缺失直接后果為何無法通過擴大規(guī)模彌補架構(gòu)缺失直接后果為何無法通過擴大規(guī)模彌補沒有空間編碼無法理解歐幾里得空間關(guān)系空間是三維連續(xù)的,Token是一維離散的,維度鴻溝無法用數(shù)據(jù)量跨越無法區(qū)分力、速度、質(zhì)量沒有物理量綱所有輸入輸出均為無量綱浮點數(shù),無法區(qū)分力、速度、質(zhì)量沒有物理量綱沒有力學求解器無法進行精確物理預測力學計算需求解微分方程,而非計算概率分布沒有時序子系統(tǒng)位置編碼僅表示順序,不是等距物理時間無法長時間穩(wěn)定動態(tài)推演沒有時序子系統(tǒng)位置編碼僅表示順序,不是等距物理時間沒有外部反饋無法與物理環(huán)境交互修正推理是單向生成,缺乏觀測-行動-反饋循環(huán)LLM的本質(zhì)是:一個沉浸于人類文字記錄的博學者,它“知道”玻璃杯掉到地上會碎,是因為這個句子在訓練數(shù)據(jù)中出現(xiàn)過無數(shù)次——而非因為它理解了彈性模量、應力傳導和沖擊能量的物理因果鏈。WFM是面向客觀時空世界的四維環(huán)境狀態(tài)預測基礎模型。其核心架構(gòu)為視覺-時序雙流設計,學習環(huán)境“狀態(tài)-動作-未來狀態(tài)”的轉(zhuǎn)移規(guī)律。版權(quán)所有:力通通信作者微信:13以JEPA(聯(lián)合嵌入預測架構(gòu))為代表:視覺編碼器將圖像幀映射為低維潛嵌入特征,時序預測器基于歷史嵌入在潛空間中預測未來狀態(tài)——不生成像素,只預測抽象表征。WFM讓AI開始“觀察”世界。通過海量視頻,它學會了預測畫面變化——球會滾、水會流、人會走。但它的邊界同樣清晰:它只是從統(tǒng)計上“猜”到了這些變化,而非從力學上“算”出了這些變化。WFM沒有獨立的三維幾何重建模塊和動力學求解模塊,無法輸出重心、受力等量化物理數(shù)值。它看見了變化,卻不懂力學。WFM的本質(zhì)是:一個通過觀看大量視頻學會了“畫面直覺”的觀察者。它能預測下一秒會發(fā)生什么畫面,但并不真正理解畫面背后的力學因果。PFM不是獨立于WFM的第四種基礎模型,而是WFM的物理增強分支:PFM=WFM視覺-時序主干+可微分物理引擎這一關(guān)系決定了:PFM在基礎模型層級中與WFM處于同一層級,但在物理精度上實現(xiàn)了質(zhì)的飛躍。版權(quán)所有:力通通信作者微信:13PFM在復用WFM視覺-時序主干的基礎上,新增三層緊耦合模塊:將RGB-D圖像、激光雷達點云轉(zhuǎn)化為標準化三維實體參數(shù):重心坐標、碰撞邊界、材質(zhì)掩碼、空間遮擋關(guān)系。層級Ⅱ:DPE——計算核心內(nèi)置固定不可訓練的全套物理微分方程組:剛體動力學(牛頓-歐拉方程)、接觸與碰撞(懲罰力/互補約束)、變形體(連續(xù)介質(zhì)力學)、流體(Navier-Stokes/SPH)。核心特性:基礎方程永久固定、不參與訓練;場景參數(shù)(摩擦系數(shù)、剛度、粘度等)可通過數(shù)據(jù)微調(diào);全程可微分,支持誤差梯度反向回流。層級Ⅲ:CTR——調(diào)度中樞全局環(huán)境狀態(tài)緩存、長序列漂移抑制、物理崩壞檢測、毫秒級硬件控制指令輸出。PFM的輸出不是像素,而是重心坐標、受力分布、傾角變化、形變程度——這些可執(zhí)行、可校驗、可追溯的量化物理參數(shù)。它是WFM唯一可工業(yè)落地、可實體執(zhí)行的增強形態(tài)。版權(quán)所有:力通通信作者微信:13VLA(Vision-Language-Action)在產(chǎn)業(yè)討論中常被誤置于與LLM、WFM并列的基礎模型層級。這一錯位必須糾正。VLA本質(zhì)上是一個應用層組合架構(gòu)方案,由三類成熟組件拼接而成:組件組件來源訓練方式視覺編碼器可復用WFM/JEPA預訓練權(quán)重可凍結(jié)或微調(diào)LLM語義編碼模塊復用LLM預訓練權(quán)重可凍結(jié)或微調(diào)動作輸出頭從零初始化端到端訓練VLA的核心貢獻在于多模態(tài)特征融合與動作映射——將視覺理解、語言理解與動作生成整合為統(tǒng)一接口。但其局限同樣明顯:VLA本身沒有獨立的預訓練主干,其能力上限受限于所復用的基礎模型的能力邊界。如果底層LLM缺乏物理因果推理能力,VLA的動作輸出就可能包含物理幻覺。對比維度對比維度LLMWFMPFMVLA概念層級基礎?;A模型基礎模型(WFM增強分支)應用組合架構(gòu)建模維度四維時空四維+物理約束建模維度四維時空四維+物理約束跨模態(tài)映射一維符號物理先驗無無顯式方程內(nèi)置可微分物理方程無(繼承底層模型能力)版權(quán)所有:力通通信作者微信:13物理幻覺嚴重普遍近乎為零繼承底層模型幻覺可執(zhí)行輸出文本畫面/潛狀量化控制指令關(guān)節(jié)動作序列獨立預訓練主有有有(復用WFM主干)無第三章推理效率:從“能看”到“能玩”世界模型長期停留于實驗室的核心原因之一是實時性不足。行業(yè)主流幀率長期掙扎在5-10FPS。而研究表明,幀率低于30FPS,一切沉浸感和交互可用性都會崩塌。2026年上半年,這一瓶頸被集中突破——過去,世界模型更多停留在學術(shù)研究和實驗階段;從研究到產(chǎn)業(yè),關(guān)注的重點從“能不能生成”轉(zhuǎn)向了“能不能實時交互、能不能穩(wěn)定部署、能不能把成本降到可用區(qū)間”。2026年7月8日,魔芯科技聯(lián)合浙江大學潘云鶴院士團隊正式發(fā)布MoWorld——全球首個FlashWorldModel,也是首個全棧基于國產(chǎn)NPU構(gòu)建的實時交互世界模型。性能維度指標產(chǎn)業(yè)意義推理幀率14BMoE模型>50FPS首次跨越實時交互門檻硬件平臺華為Ascend910CCloudMatrix384NPU全棧國產(chǎn)算力閉環(huán)部署成本僅為同規(guī)模GPU方案的30%成本降低70%長時能力首次具備2000幀長時訓練與推理支持持續(xù)超1分鐘的連續(xù)場景MoWorld接收首幀、文本和相機軌跡作為條件,生成符合場景狀態(tài)和控制輸入的未來世界狀態(tài),支持類似W/A/S/D的連續(xù)控制方式,實現(xiàn)用戶在生成世界中的實時交互。魔芯科技近期完成億元美金融資。版權(quán)所有:力通通信作者微信:132026年7月10日,螞蟻靈波發(fā)布LingBot-VA2.0,在行業(yè)普遍面臨的世界模型執(zhí)行效率低這一問題上,給出了單卡150Hz實時推理的答卷。核心技術(shù)特征:特征特征指標架構(gòu)總參數(shù)15.3B推理激活參數(shù)僅2.5B推理速度單卡150Hz(異步模式225Hz)任務成功率RoboTwin2.0雙臂93.6%LingBot-VA2.0不再沿用“從現(xiàn)有視頻生成模型微調(diào)”的路線,而是基于自回歸架構(gòu)從零開始預訓練,圍繞動態(tài)建模、因果預測和實時執(zhí)行等機器人與物理世界交互的核心需求進行原生設計。這標志著機器人基礎模型正式從“基于數(shù)字世界模型構(gòu)建”轉(zhuǎn)向“面向物理世界原生設計”。版權(quán)所有:力通通信作者微信:13大模型移植路線的訓練邏輯:互聯(lián)網(wǎng)數(shù)據(jù)預訓練→機器人數(shù)據(jù)微調(diào)。這本質(zhì)上是“先學說話,再學干活”。具身原生路線的訓練邏輯:從第一天起就用物理世界的數(shù)據(jù)訓練模型,圍繞動態(tài)建模、因果預測、實時執(zhí)行等核心需求進行原生設計。這是“從學走路開始,就為走路而設計”。設計要素技術(shù)設計要素技術(shù)實現(xiàn)設計理念語義視覺-動作分詞器視覺壓縮中融入語義與動作信息對齊使“理解指令”更容易轉(zhuǎn)化為“完成動作”嚴格因果預訓練范式從訓練開始即使用自回歸架構(gòu)確保視覺預測和動作生成完全遵循單向嚴格因果預訓練范式從訓練開始即使用自回歸架構(gòu)時間順序稀疏MoE架構(gòu)總參數(shù)15.3B,推理僅激活2.5B在不犧牲推理效率的前提下有效擴大模型容量異步推理機制執(zhí)行動作同時預測未來狀異步推理機制執(zhí)行動作同時預測未來狀態(tài)利用最新真實觀測不斷校正下一步?jīng)Q策LingBot-VLA2.0的數(shù)據(jù)規(guī)模:預訓練階段融入6萬小時高質(zhì)量真實物理數(shù)據(jù),覆蓋17個主流機器人品牌的20種機器人構(gòu)型。核心瓶頸仍在于物理世界高質(zhì)量數(shù)據(jù)的極度稀缺。仿真合成數(shù)據(jù)與人類第一視角視頻正成為突破口——智在無界團隊最早提出通過使用大規(guī)模人類第一人稱視頻訓練通用模型框架,這個路線在2026年初已從非共識逐漸走向共識。此前行業(yè)普遍采用模仿學習——通過大量真機數(shù)據(jù)讓機器人學習人類做法。但模仿學習終究只能復現(xiàn)已有經(jīng)驗,當面對訓練數(shù)據(jù)之外的新場景和復雜任務時,模型能力容易達到瓶強化學習(RL)則通過自主交互、持續(xù)試錯和獎勵反饋,不斷優(yōu)化策略,使機器人能夠持續(xù)突破SFT的能力上限。版權(quán)所有:力通通信作者微信:132026年7月,上海交通大學、百度智能云、地瓜機器人等機構(gòu)聯(lián)合發(fā)布dVLA-RL強化學習訓練框架,首次將經(jīng)典PPO算法與離散擴散VLA適配打通。維度維度指標核心突破讓VLA擺脫僅能復刻人類示范的局限,通過自主交互迭代優(yōu)化LIBEROBenchmark任務成功率99.7%RoboTwin2.0成功率從SFT的61.4%提升至92.0%(+30.6pp)技術(shù)鏈構(gòu)建“預訓練-監(jiān)督微調(diào)-強化學習”全鏈路產(chǎn)業(yè)意義:強化學習使機器人能夠持續(xù)突破SFT的能力上限——這是從“死記硬背”走向“持續(xù)自主學習”的關(guān)鍵跨越。訓練維度LLMWFMPFMVLA數(shù)據(jù)特征萬億級文本Token千萬級視頻仿真+真實物理時序圖像-語言-動作三元組最新數(shù)據(jù)突破—MoWorld2000幀視場景而定LingBot6萬小時訓練范式預訓練+SFT+RLHFJEPA自監(jiān)督三段式聯(lián)合訓練SFT+RL(dVLA-RL)核心短板無物理執(zhí)行無可執(zhí)行輸出需搭配LLM完成高層語義無長時序風險預判2026年上半年,國內(nèi)具身智能賽道融資約438億元。2025年全年約554億元,2024年約137億元——照此勢頭,2026年將再創(chuàng)新高。其中,以具身大腦為核心業(yè)務的“大腦派”公司吸納了222.53億元,占比高達50.8%;而機器人本體整機公司同期融資僅56億元,占比12.8%。超過一半的資金涌入了機器人大腦賽道——這不是溫和的傾斜,而是產(chǎn)業(yè)價值重心的劇烈遷移。35家“大腦派”公司中20家處于早期融資階段,近八成研發(fā)世界模型。全球超30億美元風險資金涌入世界模型創(chuàng)業(yè)公司,英偉達相關(guān)投資已超400億美元。摩根士丹利預測,到2035年相關(guān)產(chǎn)業(yè)規(guī)模將達10萬億美元。版權(quán)所有:力通通信作者微信:132026年被普遍視為機器人量產(chǎn)元年。資本正在用前所未有的速度與體量涌入機器人大腦——機器人下半場,由大腦說了算。產(chǎn)業(yè)正在經(jīng)歷一場從“本體競賽”向“大腦競賽”的范式遷移。硬件本體不再稀缺——經(jīng)過前兩年的爆發(fā)式發(fā)展,機器人本體的技術(shù)門檻快速下降,資本順著產(chǎn)業(yè)邏輯流向大腦。已經(jīng)上市的“機器人大腦第一股”仙工智能,正是這一趨勢的標志性事件。市場非常買賬,公開認購部分超額5934倍,8家機構(gòu)提前鎖定了4.62億港元的份額。2025年,仙工智能控制器業(yè)務毛利率高達79.8%,軟件業(yè)務毛利率89.3%。然而,高毛利的大腦敘事與低毛利的身體現(xiàn)實之間,出現(xiàn)了結(jié)構(gòu)性錯位。控制器正在從公司的利潤中心變成一個普通的走量配件。整個機器人大腦賽道都面臨同一個結(jié)構(gòu)性矛盾:資本市場給了大腦很高的估值,要求它高毛利、高溢價,但現(xiàn)實中要把業(yè)務做大,就不得不靠身體去鋪量。地區(qū)核心玩家關(guān)鍵產(chǎn)品/技術(shù)地區(qū)核心玩家關(guān)鍵產(chǎn)品/技術(shù)路線特征中國螞蟻靈波LingBot-VA2.0、LingBot-VLA2.0具身原生(數(shù)據(jù)原生/從零預訓FlashFlashWorldModel+全棧國產(chǎn)中國魔芯科技+浙大MoWorld中國智源研究院悟界·RoboBrainOrca多模態(tài)表征世界模型 中國飛捷科思Fysics引擎、Fysiverse可微分物理全棧(架構(gòu)原生)中國騰訊混元世界模型1.5全鏈路實時訓練體系 中國光象科技物理原生基座模型物理原生基座模型國際NVIDIACosmos3、IsaacGR00T物理AI開放平臺 國際GoogleDeepMindGeminiRobotics一體化VLA國際WorldLabs(李飛飛)渲染器-模擬器-規(guī)劃器框架功能分層理論盡管路線分歧顯著,業(yè)界正在形成幾個關(guān)鍵共識:版權(quán)所有:力通通信作者微信:13第一,“VLA還是世界模型”之爭正走向融合。智平方郭彥東稱世界模型是VLA體系的核心組成。VLA負責“說人話、做決策”,世界模型提供“內(nèi)嵌物理引擎”,提前模擬動作的物理后果。PFM正是這一共識的工程實現(xiàn)——它將WFM與可微分物理引擎耦合,為VLA提供物理可信的推演能力。第二,“一體化”與否尚存分歧。“本體-大腦一體化”派認為如此迭代更快、跨本體更一致;“大腦/模型平臺、不綁本體”派認為人類數(shù)據(jù)預訓練可天然向下兼容多種本體。第三,具身大腦整體仍非常不成熟。螞蟻靈波首席科學家沈宇軍指出,當前具身大腦技術(shù)路線整體仍非常不成熟,待解決問題尚多。具身大腦距離真正大規(guī)模走向真實場景,仍要跨過跨本體適配、數(shù)據(jù)飛輪、后訓練成本和商業(yè)化交付等多重門檻。CVPR2026的底層邏輯正從“看見”轉(zhuǎn)向“理解物理世界”——在3D視覺中體現(xiàn)為“3DGrounding”(要求模型輸出物體的體積與空間關(guān)系在視頻生成中體現(xiàn)為“世界模型”(要求生成內(nèi)容符合重力與碰撞)。世界模型正在以前所未有的速度與具身智能、自動駕駛等物理世界任務深度融合。 工作會議/期刊核心貢獻與本報告關(guān)聯(lián)物理可控世界模型CVPR2026Highlight從原始視頻學習場景物理結(jié)構(gòu),支驗證“物理狀態(tài)作為中持估計任意視覺變量的概率間層”的可行性WMRewardCVPR2026Highlight推理時用隱世界模型引導視頻生成器生成物理合理的輸出視頻生成從“只管生成”到“物理對齊”悟界·RoboBrainOrca智源(2026.07)從預測“下一個詞”走向預測“下一個統(tǒng)一跨模態(tài)世界表征世界狀態(tài)”空間物理可行的世界模型arXiv2026具身AI的世界模型必須具備物理可行性為PFM區(qū)別于WFM提供理論根基ω-EVAarXiv2026“想象-驗證-行動”循環(huán)的潛交互世界模型驗證PFM的預驗證能力世界模型評估新范式評價重點從畫面質(zhì)量轉(zhuǎn)向行動后果預測能力世界模型評估標準的范式轉(zhuǎn)變版權(quán)所有:力通通信作者微信:136.3核心趨勢:從“看見”到“理解”智源悟界·RoboBrainOrca代表了這一轉(zhuǎn)變的核心理念:從預測“下一個具體模態(tài)輸出”走向預測“下一個世界狀態(tài)”。Orca在看到一段視頻、一張圖、一個指令后,會先在內(nèi)部形成一個統(tǒng)一的世界潛在表征空間——就像Al“腦海中的世界”。它把視覺、語言、事件、任務意圖等多模態(tài)信號組織起來,學習物體如何運動、場景如何變化、動作會帶來什么后果、事件之間有什么因果關(guān)系。Orca的目標不是做一個更會回答的大模型,也不是做一個更會畫圖的圖像生成模型——它想做的是一件更底層的事:讓Al在“腦海中”形成一個對當前世界狀態(tài)高度濃縮的表征,并基于此建模世界狀態(tài)的演變。這正是物理大模型“物理狀態(tài)作為中間層”的學術(shù)呼應。南京大學人工智能學院團隊發(fā)布的綜述性立場論文明確指出:面向具身智能和機器人決策的世界模型,評價重點應落在其對行動后果的預測能力、對策略優(yōu)劣的判斷能力,以及對規(guī)劃和優(yōu)化的實際支持能力上。視頻是否逼真、畫面是否流暢、語義是否貼合指令——這些維度依然重要,但它們不再是全部。世界模型的競爭,正在從畫面質(zhì)量的競爭走向世界狀態(tài)與因果推演能力的競爭?;谇傲碌姆治?,本章提出一個面向產(chǎn)業(yè)落地的分層協(xié)同架構(gòu):版權(quán)所有:力通通信作者微信:13各層職責:層級核心模型職責輸出語義層LLM人類指令理解、長任務拆解、常識推理子目標序列想象層WFM/PFM場景預判、物理推演、風險評估動作候選驗證執(zhí)行層VLA+PFM校驗動作生成、物理安全過濾、實時控制關(guān)節(jié)指令場景需求推薦方案核心理由純文本業(yè)務(客服/問答/代碼)無視覺、無控制需求AI視頻生成/游戲畫面仿真LLM+WFM需語義理解+時空想象,無實體控制低安全家用娛樂機器人輕量化部署,低風險動作高安全工業(yè)/自動駕駛LLM+VLA+PFMVLA快速映射,PFM長時序物理風險校驗全鏈路一站式開發(fā)自研UEI融合架構(gòu)替代多模型串聯(lián)部署方向方向機制效果LLM為LLM為WFM/PFM補充人類常識與長任務拆解邏輯自下而上PFM/WFM仿真推演校驗VLA/LLM動作方案過濾違背力學規(guī)律的指令,根治物理幻覺版權(quán)所有:力通通信作者微信:13技術(shù)方案核心短板根本原因缺少空間量化感知與物理推演架構(gòu)本質(zhì)是概率擬合,非因果求解WFM無標準化顯式力學約束所有規(guī)律由數(shù)據(jù)隱式擬合VLA僅單步動作映射無長時序風險預判能力,繼承底層模型幻覺需搭配LLM完成高層語義物理精度與語義靈活性存在權(quán)衡多模型串聯(lián)的共性痛點:跨模型調(diào)度復雜、多模態(tài)對齊困難、綜合算力開銷高、誤差跨模塊累積難以根治。螞蟻靈波首席科學家沈宇軍指出:當前具身大腦技術(shù)路線整體仍非常不成熟,待解決問題尚多。具身大腦距離真正大規(guī)模走向真實場景,仍要跨過跨本體適配、數(shù)據(jù)飛輪、后訓練成本和商業(yè)化交付等多重門檻。第一,推理效率持續(xù)突破。MoWorld的50FPS、LingBot-VA2.0的150Hz證明世界模型已跨越實時性門檻。下一步是從“能用”走向“好用”——更低成本、更廣場景、更穩(wěn)定部署。第二,訓練范式從模仿走向進化。dVLA-RL打通VLA強化學習路徑,標志著機器人從“死記硬背”走向“持續(xù)自主學習”。這一范式將加速向更多場景擴散。第三,“具身原生”完整光譜走向成熟。數(shù)據(jù)原生(LingBot)與架構(gòu)原生(PFM)共同構(gòu)成具身原生的完整技術(shù)光譜。預計更多團隊將在這兩條子路徑上深入探索。第四,統(tǒng)一跨模態(tài)表征。將文本、圖像、點云、動作、物理參數(shù)統(tǒng)一映射至同一潛空間——智源悟界·RoboBrainOrc

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負責。
  • 6. 下載文件中如有侵權(quán)或不適當內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論