具身智能下半场:世界模型驱动下的物理感知强化学习

导语:人类对具身智能的长期期待是构建能够走出结构化场景适应开放物理世界并在持续交互中不断学习修正与成长的通用物理智能体

人类长期以来对“通用物理智能体”怀有明确而持久的期待:它不应只是被固定在工厂产线中重复执行预设动作的自动化设备,而应是能够进入陌生环境、理解复杂物理情境,并以灵活身体完成开放性任务的智能系统。然而,这一目标至今仍未真正实现。尽管机器人学已经在工业制造、仓储物流、自动驾驶和医疗辅助等场景中取得了显著进展,但这些成功通常依赖明确的任务边界、经过设计的环境条件,以及相对可控的系统假设。回顾机器人学的发展脉络,我们可以发现,这种局限具有相当的历史连续性:从早期以显式编程、精确控制为基础的工业自动化范式,到后来以感知、建模、规划和控制为核心的模块化智能系统,再到深度学习推动的数据驱动策略学习,机器人能力的适用范围在很大程度上仍然由人类预先设定的环境、接口和数据分布所限定。


简言之,过去数十年的技术进展显著提升了机器人在特定场景中的执行能力,却并没有从根本上回答开放物理世界中的通用性问题:当任务、环境、物体属性和交互条件不断变化时,机器人如何获得一种能够迁移、复用并继续扩展的能力获取机制?


近年来,基础模型在语言、多模态智能中的成功,为机器人学提供了新的参照。大规模预训练表明,通用能力并不一定完全依赖精细的人工规则、任务特定建模或高度模块化的系统设计,而可能来自数据规模、模型容量和任务多样性的共同扩展。受这一思路影响,具身智能研究开始从传统的任务级学习转向规模化行为学习。通过收集大规模、多任务、多场景的机器人操作数据,并训练统一的视觉-语 言-动 作 模 型(Vision-Language-Action Model,VLA),机器人可以在语言指令、视觉观测和动作生成之间建立端到端映射。这一变化使机器人研究逐渐从“为每个任务单独设计系统”转向“让统一模型吸收多样化经验”,也由此开启了具身智能由规模化预训练驱动的上半场。


大规模预训练范式的主要贡献,在于它为机器人能力习得提供了一种不同于传统任务级系统的新路径。大规模视觉-语言-动作模型不再只是面向单一任务的控制器,而是能够融合视觉、语言、触觉等多模态信息,并在多任务操作中学习具有迁移性的行为先验。这类模型已经能够根据自然语言指令完成抓取、放置、移动、整理等多种操作,并在一定程度上表现出跨对象、跨场景和跨任务的泛化能力。


更重要的是,这一范式改变了机器人能力获取的基本方式:能力不再完全来自人工编程、模块拼接或单任务训练,而是来自对大规模经验的压缩、对齐和复用。由此,机器人学第一次较为接近基础模型的发展路径,即通过统一模型及规模化数据积累,形成可以迁移、组合和扩展的通用行为能力。



不过,仅靠规模化离线模仿学习,仍然不足以支撑通用具身智能的长期目标。当前,视觉-语言-动作模型的能力主要来自对历史数据分布的拟合。当测试场景与训练经验相近时,模型往往能够生成合理动作;不过,一旦面对未见过的物体属性、复杂接触动力学、长程任务依赖、异常失败状态或开放环境中的长尾情形,单纯模仿已有轨迹就很难保证可靠决策。根本原因在于,离线数据只是过去经验的有限记录,无法穷尽真实世界中高度多样的物理状态、任务组合和交互后果。模型可以从数据中学习到强大的行为先验,却难以仅凭这些先验主动发现错误、修正策略,并在新的交互中产生持续的能力增长。


因此,具身智能若要进一步突破现有边界,便需要引入更加明确的交互闭环学习机制,从“离线行为建模”走向“在线主动学习”。如果说大规模预训练解决的是如何从离线数据中获得可迁移行为先验的问题,那么更进一步的问题则是:机器人如何在与环境的持续交互中学习决策、动态和因果关系。此时,机器人不应只是历史数据的使用者,而应逐渐成为新经验的生成者。它通过行动改变环境,通过观测获得反馈,通过反馈评估行为后果,并在试错与修正中不断更新自身策略。


基于这一脉络,本文将规模化预训练驱动的阶段概括为具身智能发展的“上半场”,将交互反馈与决策优化驱动的阶段概括为具身智能发展的“下半场”。前者依靠大规模离线数据及统一行为模型,为机器人提供可迁移的行为先验;后者则将这些先验接入真实或高保真环境反馈,使机器人能够在行动、观测、评估和修正构成的闭环中继续改进。二者并非相互替代,而是前后衔接的递进关系。没有规模化预训练,机器人缺乏足够强的初始能力与语义基础;没有交互闭环,这些先验又难以在开放环境中得到验证、修正和扩展。


从这一角度看,世界模型、强化学习、长期规划和持续适应并不是彼此孤立的研究方向。它们实际上共同指向同一个问题:如何让机器人在与世界的交互中形成可持续增长的能力闭环。世界模型关注动作与环境变化之间的动态关系,使机器人能够预测行为后果;强化学习关注长期目标下的策略优化,使机器人能够根据反馈调整行为选择;在线交互则为系统提供突破离线数据分布的新经验,使机器人可以在真实任务中发现并修正自身不足。由此,具身智能的发展不应仅仅被理解为训练更大的离线模型,而应被理解为构建一个能够在物理世界中持续预测、行动、反馈和改进的学习系统。


图 1 具身智能的学习范式转变


本文将围绕这一转变展开讨论。如图1所示,首先,我们回顾规模化学习如何推动具身智能进入“上半场”,并分析视觉-语言-动作模型为何可以成为通用机器人行为模型的重要起点;其次,我们讨论这一范式的局限,指出离线模仿学习在动态理解、长期决策、失败恢复和开放环境适应方面仍然存在根本不足;最后,我们进一步论证交互与决策驱动的学习范式为何构成具身智能的“下半场”,并讨论机器人如何借助真实环境反馈,实现从行为复现到能力持续提升的转变。


1 上半场:规模化模仿学习范式的兴起


由规模化预训练、大规模模仿学习所推动的范式转变,构成了具身智能发展的“上半场”。这一阶段的核心在于机器人能力的获取方式开始发生根本变化:从围绕单一任务进行系统设计、数据采集和策略训练,转向通过大规模、多任务、多场景数据训练统一的视觉-语言-动作模型,并从中形成可迁移、可组合、可复用的行为先验。即,上半场真正回答的是一个更基础的问题:机器人是否能够像语言模型与多模态基础模型一样,通过规模化数据及统一模型架构,学习一种超越单任务边界的通用行为基础。


具身智能的“上半场”之所以能够开启,并不是因为某个单一算法突然解决了机器人问题,而是几类基础条件在同一时期逐渐成熟:机器人硬件、传感器和遥操作系统的工程化,使真实操作数据能够以更低成本被持续采集;跨平台数据集及共享数据计划,使机器人经验从零散实验转向规模化积累;视觉语言模型与大语言模型提供了强大的语义先验,使机器人不必完全依赖有限轨迹从零学习物体、场景和任务含义;Transformer式统一序列建模则为视觉、语言、状态和动作的联合表示提供了通用架构。


图 2 设备规模化、数据规模化与模型规模化为具身智能上半场开启提供了条件


因此,具身智能上半场的本质,是“设备规模化-数据规模化-模型规模化”之间形成了正反馈(如图2所示):更可扩展的机器人设备带来更多真实操作数据,更大的多任务数据支撑更强的模仿学习模型,而多模态大模型先验及统一多模态架构又使这些数据能够被组织为可迁移、可组合、可复用的行为能力。由此,机器人能力的获取方式开始发生根本变化:从围绕单一任务进行系统设计、数据采集和策略训练,转向通过大规模、多任务、多场景数据训练统一的视觉-语言-动作模型,并从中形成通用行为先验。即,上半场真正回答的是一个基础问题:机器人是否能够像语言模型一样,通过规模化数据与统一模型架构,学习一种超越单任务边界的通用行为基础。


1.1 从任务特定系统到规模化行为学习


在相当长的时间里,机器人研究主要建立在任务特定系统之上。一个典型机器人系统往往围绕某个明确任务被单独设计:感知模块负责识别有限类别的物体,规划模块在预设约束中生成动作序列,控制模块则针对特定平台、动作空间和执行流程进行反复调参。这种方式在结构化环境中通常能够取得稳定表现,但其能力边界也十分清晰。一套能够完成桌面抓取的策略,未必可以直接用于抽屉开合、物体整理或双臂协作;一个在实验室中表现良好的模型,也可能在真实家庭或开放工作空间中因场景布局、物体形态或光照条件变化而迅速失效。因此,传统机器人系统长期被限制在“单任务、单场景、单策略”的框架内。它们更接近针对具体问题的工程优化,而不是面向通用能力的学习机制。


这种局限并不只是算法能力不足造成的,也与机器人领域长期存在的数据瓶颈密切相关。与文本、图像和视频等互联网数据不同,机器人数据无法被低成本、大规模地直接抓取。每一次抓取、推动、接触、装配或移动,都需要真实时间、硬件设备、传感器系统,以及人工操作的投入。与此同时,机器人数据还受到平台形态、控制频率、动作空间、传感器配置和环境条件的影响。不同实验室、不同机器人,甚至不同控制接口之间的数据往往难以直接复用。这使得机器人学习很难像语言模型那样依赖互联网规模的现成语料获得能力跃迁。长期以来,许多策略只能在小规模实验室数据上训练,其泛化能力也自然被限制在狭窄的任务分布之内。


规模化模仿学习的兴起,首先改变的正是机器人学习的数据基础。随着低成本遥操作系统、可扩展数据采集平台和跨机构数据共享逐渐成熟,机器人操作数据开始从零散的实验室采集转向更系统化的工程建设。ALOHA通过低成本双臂硬件与同步遥操作框架提高了高质量双臂操作数据的采集效率;UMI进一步将数据采集带入真实家庭、日常场景,使模型能够接触更复杂的交互分布;DexCap等基于视觉手套或人体动作捕捉的方法,则为灵巧操作、人手示范数据提供了新的采集路径。与 此 同 时,Open X-Embodiment、DROID、Bridge Data等跨机构数据开始整合不同机器人平台、任务类型和环境分布下的操作轨迹,使机器人领域初步形成了类似“共享经验池”的数据生态。这一变化的意义并不只是“数据量变大”。


更重要的是,机器人研究的组织方式开始发生转向:过去,系统能力主要来自研究者显式设计的规则、接口和控制结构;而在规模化学习范式下,能力越来越多地来自多样化经验本身。模型不再只学习某个任务中的输入到动作映射,而是在大量任务、物体和场景之间寻找可共享的行为模式。换言之,机器人学习的目标不再只是训练一个完成特定任务的策略,而是希望获得一种能够为多种下游任务提供初始能力的行为先验。


这一转变与自然语言处理中的基础模型发展具有某种结构上的相似性。早期语言系统依赖人工设计的语法规则、词典和任务特定特征,而大语言模型的成功表明,语言能力可以通过大规模文本数据、统一模型架构和预训练目标得到显著扩展。机器人领域也在经历类似的转向:系统能力逐渐从显式规则与任务特定控制中解耦,开始通过大规模具身交互经验形成更统一的行为表示。不过,机器人面对的对象并不只是符号或像素,而是由身体、动作、接触和反馈共同构成的物理世界。因此,规模化行为学习虽然借鉴了基础模型的基本思想,却必须处理更加复杂的动力学约束、交互成本和安全边界。


1.2 视觉-语言-动作统一建模


如果说数据规模化解决的是经验来源问题,那么视觉-语言-动作模型试图解决的,则是具身智能中的统一表示问题。长期以来,机器人系统大多采用模块化架构:视觉模块负责环境感知,语言或任务模块负责目标解析,规划器生成动作序列,控制器执行底层运动。这种分解方式具有较强的工程可解释性,也便于针对局部问题进行优化。但它同样带来了明显问题:不同模块之间依赖人工设计的接口及中间表示,感知误差、语义歧义和规划偏差容易在模块边界不断累积。一旦环境分布、任务描述或物体状态偏离预设条件,系统整体行为就可能出现不稳定。


基础模型的兴起为这一问题提供了新的技术路径。Transformer等通用序列建模架构表明,语言词元(Token)、视觉区块(Patch)、视频帧、状态观测和动作轨迹都可以在统一框架下处理。对于机器人而言,这意味着视觉观测、语言指令和动作输出不必再被完全割裂为独立模块,而可以被共同组织到一个模型中学习。视觉 - 语言 - 动作模型正是在这一背景下出现的:它们试图在同一参数空间中对齐“看见什么”“要做什么”“如何行动”,从而将任务理解与动作生成纳入同一个学习过程。


Robotics Transformer(RT)系列工作是这一方向的重要早期尝试。通过结合视觉语言预训练与机器人控制数据,模型开始能够根据自然语言指令完成多种操作任务,并在不同物体与场景之间展现出一定的泛 化 能 力。随 后,OpenVLA、Octo、SayCan、VIMA等工作进一步推动了统一具身模型的发展。这些方法不再为每个任务训练独立控制器,而是使用共享模型骨干同时处理视觉观测、语言目标和动作序列,使多个任务能够在同一参数空间中共享表示和经验。随着数据采集方式不断扩展,触觉、力反馈和人手动作信息也开始被纳入模型输入,具身模型逐渐从视觉-语言-动作三元结构走向更丰富的多模态交互建模。


这一阶段的价值,并不只是机器人能够执行更多操作任务,而在于机器人能力的组织方式发生了变化。在传统任务策略中,每个任务通常对应独立的数据、策略和优化目标;而在视觉-语言-动作模型中,不同任务被放入同一个模型中共同训练。模型因此有机会学习抓取、放置、整理、开合、移动等操作之间共享的行为结构,例如目标定位、接近物体、建立接触、调整姿态,以及根据视觉反馈修正动作。


由此,机器人学习的对象不再只是某条具体轨迹,而是跨任务可迁移、可组合、可复用的行为先验。这种新的能力组织方式,为机器人从任务特定系统走向通用行为模型提供了重要起点。


1.3 行为先验与基础策略的雏形


规模化模仿学习的核心产物,是行为先验。所谓行为先验,并不是指机器人已经理解所有物理规律,或者能够在任意环境中自主完成任务,而是指模型通过大量示范轨迹学习到一组可迁移的行动倾向及操作模式。例如,面对桌面物体时,模型可以学习如何接近目标、调整末端姿态、在接触前减速、在放置时保持稳定,并根据视觉变化修正后续动作。这些能力未必对应明确的符号规则,却可以在多种任务中被反复复用。


这使规模化模仿学习区别于传统的单任务行为克隆。小规模任务数据往往只能让模型记住某一任务分布中的动作模式,而大规模、多任务、多场景数据则使模型有机会学习任务之间共享的结构。虽然,抽屉开关、物体搬运和桌面整理目标不同,但都包含空间对齐、接触建立、位姿调整和阶段性动作切换等共性成分。当这些经验在统一框架中被反复建模时,模型便可能形成跨任务的操作先验,并在新任务中提供更好的初始化能力。


由此,机器人策略开始从“任务策略”走向“基础策略”的雏形。任务策略通常绑定于特定任务及环境,一旦目标、物体组合或场景布局发生变化,便需要重新训练或大幅调整;基础策略则试图通过大规模跨任务数据学习通用行为基础,并在下游任务中通过提示、微调或少量数据实现适配。当前,视觉-语言-动作模型距离真正通用的基础策略仍有距离,但它们已经显示出一种重要可能:机器人策略不再必须从每个任务重新开始,而可以从包含多任务经验的预训练行为模型出发。


1.4 上半场的意义与未完成性


规模化模仿学习构成具身智能上半场,是因为它为机器人提供了迈向通用物理智能所必需的初始能力基础。没有大规模预训练,机器人系统很难获得足够丰富的语义理解、物体知识和操作经验,也很难在新任务中形成有效的行为初始化。视觉-语言-动作模型的出现表明,机器人能力可以不再完全依赖任务特定工程设计,而可以通过规模化数据与统一模型结构获得一定程度的迁移性和组合性。但上半场同时也是不完整的。大规模模仿学习主要学习的是历史数据中的行为分布,它擅长回答“在类似场景中,人类或专家通常会如何操作”,却难以回答“当环境偏离经验分布时,机器人应如何主动探索、判断错误并修正策略”。模型可以从示范数据中获得强大的行为先验,却仍然缺少通过真实行动生成新经验、通过环境反馈评估后果,并通过在线更新持续改进自身能力的闭环机制。


由此,上半场为具身智能提供了重要起点,也自然引出了它的边界。规模化预训练使机器人具备了可迁移的行为先验,但开放物理世界要求的不只是复现已有经验,而是在未知状态中行动、反馈、试错和改进。正是在这一意义层面,规模化模仿学习并不是具身智能发展的终点,而是后续交互闭环学习的基础。下一阶段的关键问题将不再只是如何训练更大的离线行为模型,而是如何将这些预训练先验接入真实或高保真环境反馈,使机器人能够在持续交互中修正、强化,并扩展自身能力。


2 上半场的边界:为什么模仿不足以通向物理智能


规模化模仿学习的成功,使机器人领域第一次展现出类似基础模型的发展趋势。视觉-语言-动作模型借助大规模跨任务示范数据,在多类操作任务上表现出比传统单任务策略更强的泛化能力,也由此形成了一种自然的乐观预期:既然语言智能可以通过大规模预训练获得强大的通用能力,那么物理智能是否也可以沿着“更多数据、更大模型、更统一架构”的路径持续扩展?


当机器人系统从相对受控的数据集、实验环境进入更开放、更复杂的真实世界时,这一路径的根本边界开始显现。问题并不在于模仿学习无效,而在于模仿学习所解决的问题,与物理智能所要求的问题并不相同。模仿学习主要回答的是:在类似观测及类似任务条件下,专家通常会采取什么动作;而物理智能进一步要求机器人实现:某个动作将如何改变世界状态,以及当结果偏离预期时,应当如何通过反馈修正后续行为。


自然语言模型之所以能够从互联网规模文本中获得强大的泛化能力,一个重要前提在于,语言数据可以以人工采集形式大规模积累。文本虽然语义复杂,但训练信号主要来自离线语料中的词元共现、语义组合和上下文预测。模型不需要真正改变外部世界,也能够通过海量文本逼近语言使用中的统计规律。物理世界则不同。机器人面对的是由身体、物体、接触、力、运动和环境扰动共同构成的开放动态系统。


一个看似简单的抓取动作,其结果可能同时受到接触角度、摩擦系数、材质形变、物体重心、末端执行器姿态、运动惯性和局部遮挡等连续变量影响。这些变量之间并非简单叠加关系,而是存在高度非线性的耦合。更重要的是,物理交互的结果往往只有在行动发生之后才会显现。机器人无法仅通过观察历史轨迹穷举这些后果,也无法依靠覆盖既有数据分布,保证对所有新场景的可靠泛化。因此,上半场真正触及的边界,并不是单纯的数据规模边界,而是“行为拟合”这一范式本身的边界。


2.1 行为拟合的边界:为什么模仿不能形成物理闭环


规模化模仿学习的基本目标,是从专家示范数据中学习一个条件策略πθ。设专家数据集为


式中,st表示机器人在时刻t的决策状态,可由视觉观测、机器人本体状态、历史信息等信息构成, at表示专家动作,g表示任务指令或目标。行为克隆的典型优化目标可以写作:

这一目标的含义是:在给定决策状态 st 和任务目标g的条件下,模型学习专家通常会采取什么动作。换言之,模仿学习主要拟合的是专家策略分布πE(at|st,g)。这对于获取行为先验非常有效。通过大规模跨任务示范数据,机器人能够学习到许多操作中的共性模式,如接近目标物体、调整末端姿态、建立接触、抓取、搬运、放置,以及根据局部视觉反馈进行修正。视觉 - 语言 - 动作模型的价值,正在于它把这些分散的操作模式压缩为一个较为通用的行为分布,使机器人不再需要为每一个任务单独训练控制器。


但问题在于,行为分布并不等同于物理理解。模仿学习的学习目标是p(at|st,g),而物理智能更需要掌握的是动作对世界状态的影响P(at+1|st,at)。前者回答的是“在类似观测下,专家通常如何行动”;后者回答的是“如果执行某个动作,世界会如何变化”。这一区别决定了模仿学习虽然能够形成强大的行为先验,却不必然形成稳定的物理因果理解。机器人可能学会在某种视觉状态下伸手、靠近、闭合夹爪,但它未必真正理解不同接触角度、不同抓取力度、不同物体材质和不同运动轨迹会如何改变后续状态。


这种边界在长程任务及复杂操作中尤其明显。训练时,模仿学习看到的是专家状态分布;部署时,机器人面对的却是自身策略执行出的状态分布。给定策略 ,其执行轨迹分布可以写作:

式中, 表示一条交互轨迹,ρ‌(s0)表示初始状态分布。只要机器人某一步动作产生轻微偏差,后续观测就可能偏离专家数据分布;而一旦进入示范数据未覆盖的状态区域,模型便缺少判断失败原因和主动修正策略的机制。抓取稍微偏离、物体轻微滑动、抽屉拉动方向不合适、障碍物被意外碰倒,这些局部偏差都会改变后续状态,使机器人进入训练数据中很少出现的情境。此时,单纯依赖“专家在类似状态下通常怎么做”的行为拟合,往往不足以支撑可靠恢复。


因此,分布偏移、误差累积、失败恢复不足和反事实能力不足,并不是彼此独立的问题,而是同一个根本缺口的不同表现:离线模仿学习主要复现历史行为,却没有真正把机器人置于“行动-反馈-修正”的物理闭环之中。机器人不仅需要知道专家做了什么,还需要能够比较不同行动可能带来的后果,诸如对应当前状态的不同动作生成的未来状态:

只有当系统能够预测、比较并利用这些后果时,它才可能在抓取失败、物体滑落、抽屉卡住、路径受阻或任务中途偏离时进行有效修正。换言之,模仿学习的边界并不只是数据规模的边界,而是“行为拟合”这一范式本身的边界。更多示范数据可以扩大行为覆盖范围,却不能从根本上替代机器人在物理世界中通过行动获得反馈、通过反馈修正策略的能力。


2.2 从观察式学习到交互式学习


由此可以看出,规模化模仿学习构成了具身智能的上半场,因为它证明了机器人可以通过大规模示范数据学习到具有迁移性、组合性和复用性的行为先验。视觉-语言-动作模型不再只是在单一任务上拟合一个特定控制器,而是能够在多任务、多场景、多物体条件下学习较为通用的动作模式。这使机器人第一次接近了基础模型式的发展路径。


但从学习范式看,模仿学习本质上仍然是一种观察式学习。机器人主要从已有轨迹中学习专家在特定观测下采取了什么动作。它看到的是别人如何完成任务,却并不必然理解某个动作为什么会导致某种后果,也不必然知道当后果偏离预期时应当如何修正。换言之,模仿学习能够回答“在类似情境下专家通常会怎么做”,但难以充分回答“如果我这样做,世界会怎样变化”。


具身智能下半场的关键,正是从这种观察式学习转向交互式学习。机器人不应只是被动吸收静态数据集中的历史经验,而需要主动进入环境,通过行动产生新数据,通过反馈评估行动后果,并通过持续修正改进自身策略。即,机器人能力的来源不能只停留在离线数据分布中的统计规律,还必须来自与物理世界持续交互所形成的闭环经验。


世界模型与强化学习之所以重新变得重要,正是因为它们分别补足了模仿学习中缺失的两个关键环节。


首先,世界模型补足的是动态理解能力。模仿学习直接学习从观测到动作的映射,而世界模型试图学习动作对世界状态的影响。有了世界模型之后,机器人不再只能在当前观测下选择一个看起来“像专家”的动作,而可以在行动之前推演不同动作可能导致的未来状态。它可以比较:从左侧抓取是否更稳定,先推再抓是否能减少遮挡,减小拉力是否能避免抽屉卡住,调整接触角度是否能降低物体滑落风险。世界模型的意义不只是预测下一帧或下一个状态,而是把机器人从“复现动作”推向“预测后果”。


其次,强化学习补足的是闭环改进能力。即使机器人能够预测若干未来状态,它仍然需要判断哪些后果是好的,哪些后果是坏的,哪些失败应当避免,哪些探索值得继续。强化学习把评价标准从“动作是否像专家”转向“结果是否有效”,其基本目标可以写作。在这个目标下,机器人不再只是匹配专家动作,而是在环境反馈中优化长期结果。对于物理任务而言,这一点尤其关键,因为许多操作并不存在唯一正确的专家动作。拿起一个杯子、打开一个抽屉、整理一张桌面或推开一个障碍物,都可能存在多种可行策略。模仿学习倾向于复现示范中的动作模式,而强化学习允许机器人根据自身身体结构、执行约束和环境反馈,发现与专家不同但同样有效,甚至更适合当前情境的策略。更重要的是,交互式学习使失败成为学习过程的一部分。在纯模仿学习中,失败状态往往很少出现在专家数据中,因此一旦机器人偏离示范轨迹,模型可能不知道如何恢复。而在强化学习中,失败不是分布外噪声,而是反馈信号。机器人可以通过奖励、惩罚或偏好反馈识别哪些动作导致失败,并在后续策略更新中降低这些动作被选择的概率。这样,机器人开始具备一种从自身行动后果中改进行为的能力。


因此,世界模型与强化学习并不是对模仿学习的简单替代,而是把模仿学习形成的静态行为先验转化为动态物理智能的关键机制。模仿学习提供起点,世界模型提供对未来的推演,强化学习提供基于结果的优化。三者之间的关系不是互斥的,而是递进的:先通过大规模模仿学习获得基本行为能力,再通过世界模型理解行动后果,最后通过强化学习在环境反馈中持续修正和扩展策略。从这个意义层面,具身智能的发展正从观察式学习逐渐走向交互式学习。上半场的核心是利用大规模数据形成通用行为先验;下半场的核心则是让这个行为先验进入环境,在行动、预测、反馈和修正的闭环中持续进化。机器人不仅要能够复现已有经验,还要能够在未知状态中行动,在行动前预测可能后果,在行动后利用反馈修正自身行为。


如果说上半场回答的是:机器人能否通过大规模模仿学习形成可迁移、可组合、可复用的通用行为先验,那么下半场需要回答的则是:机器人能否通过与物理世界持续交互,形成可预测、可修正、可优化、可扩展的动态智能,这就是从观察式学习走向交互式学习的真正含义,也是世界模型与强化学习重新回到具身智能核心舞台的根本原因。真正通向物理智能的路径,不能停留在离线行为拟合,而必须走向在线交互闭环。


3 下半场:交互与决策驱动的具身智能


如果说具身智能的上半场,本质上在回答“机器人能否通过规模化模仿学习获得通用行为先验”这一问题,那么下半场真正需要回答的是一个更进一步的问题:机器人能否在与物理世界的持续交互中,形成关于行动后果的动态理解,并根据反馈不断改进自身决策。


规模化模仿学习已经证明,大规模机器人数据、视觉语言预训练和统一动作建模能够显著提升机器人策略的跨任务泛化能力。视觉-文本-动作基础模型的核心价值,也正在于它们能够从大量示范轨迹中学习到可迁移、可组合、可复用的行为模式。它们让机器人不再只是为单个任务训练一个专用控制器,而是开始具备类似基础模型的通用行为基础。


但模仿学习存在两个关键问题。第一个关键问题是其缺少对行动后果的显式建模,在给定观测及任务目标的条件下,专家通常会采取什么动作。但物理智能需要面对的是,一个动作执行之后,世界状态将如何变化。前者是行为分布,后者是交互运动学与动力学。机器人可以通过模仿学习学会“在类似情境下应该做什么”,却不必然知道“如果我这样做,物体会不会滑落,抽屉会不会卡住,杯子会不会倾倒,下一步是否还有可行操作空间”。第二个关键问题是其缺少基于结果的闭环改进机制。模仿学习的训练信号主要来自专家示范,因此它更擅长复现已有行为,而不是从自身行动造成的后果中主动修正策略。部署到真实环境后,机器人一旦进入专家数据很少覆盖的状态,例如抓取偏移、接触失败、物体滑动、路径受阻或任务中途偏离,单纯的行为拟合往往无法判断失败原因,也无法系统性地更新后续行为。换言之,模仿学习可以让机器人获得“初始会做”的能力,但它本身并不构成“越做越会”的成长机制。


这两个缺口,正好对应下半场的两个核心技术方向:世界模型与强化学习。


世界模型要补足的是第一个缺口:行动后果预测。它试图学习动作如何改变世界,使机器人能够在真正执行之前,对不同动作可能导致的未来状态进行推演。没有世界模型时,机器人只能根据当前观测输出一个看起来像专家的动作;有了世界模型之后,机器人可以比较多个候选动作的后果:从左侧抓取是否更稳定,先推再抓是否能减少遮挡,减小拉力是否能避免抽屉卡住,调整接触角度是否能降低滑落风险。即,世界模型把机器人从“复现动作”推进到“预测后果”。


强化学习要补足的是第二个缺口:基于反馈的策略改进。仅仅预测未来并不够,机器人还必须判断哪个未来更好,哪些失败应当避免,哪些探索值得继续。强化学习提供的正是这种优化机制。它把学习目标从“动作是否像专家”转向“结果是否有效”,使机器人能够根据任务成功、阶段进展、碰撞惩罚、接触稳定性、安全约束或人类偏好反馈更新策略。换言之,强化学习把机器人从“模仿已有行为”推进到“优化长期结果”。


因此,世界模型与强化学习并不是两个并列堆叠的模块,而是下半场闭环智能的两个互补环节。世界模型回答的是:如果我执行某个动作,世界接下来会怎样变化;而强化学习回答的是:在这些可能的未来中,我应该选择哪一种行动,并如何根据结果改进策略。


二者结合之后,机器人才能够从静态策略模型走向交互式智能体。世界模型提供可预测的未来,使强化学习不必完全依赖昂贵且高风险的真实试错;强化学习提供决策目标,使世界模型的预测不只是生成未来状态,而是服务于任务完成、失败避免和长期回报优化;真实环境反馈则不断校正二者,避免世界模型偏离真实物理规律,也避免策略只在模型内部获得虚假的高回报。

图 3 基于世界模型的想象 - 矫正 - 执行 - 持续优化闭环流程

从这个角度看,下半场的关键不是简单地把世界模型与强化学习重新加入机器人系统,而是建立一个如图3所示的新的能力循环:行为先验→行动后果预测→基于结果的决策优化→真实环境反馈→模型与策略更新。规模化模仿学习得到的基础策略提供初始行为先验;世界模型负责预测行动将如何改变世界;强化学习负责根据预测结果及真实反馈改进策略;真实环境则提供最终校验与持续更新信号。三者结合之后,机器人能力的来源不再只是静态数据集中的历史轨迹,而是逐渐转向“数据-模型-行动-反馈-更新”的持续闭环。


也正是在这个意义层面,下半场并不是对上半场的否定。上半场提供了必要的起点:没有大规模模仿学习,机器人很难获得足够广泛的初始行为能力;但如果只有模仿学习,机器人又会被历史数据分布所限制,难以在开放物理世界中持续适应。因此,下半场的核心不是抛弃基础策略,而是把基础策略放入一个能够预测、试错、反馈和更新的交互系统之中。具身智能的发展路径也因此从大规模离线预训练进一步走向大规模交互式后训练。


前者让机器人获得“会做事”的初始能力,后者则让机器人获得“在做事中变得更会做”的成长机制。真正通向物理智能的路径,不是无限扩大离线示范数据,而是让机器人在真实或高保真环境中持续生成经验、预测后果、优化决策,并在反馈中修正自身能力。


3.1 从静态策略到闭环智能体


上半场的典型机器人模型可以被理解为一个条件策略πθ(at|st,g),其中st表示当前可决策状态,g表示语言指令或任务目标,at表示机器人动作。这个策略主要来自离线示范数据。其优势在于能够让机器人获得相当广泛的初始行为能力,例如接近物体、建立接触、抓取、移动、放置,以及根据局部视觉变化进行修正。但这种策略本质上仍然受到历史数据分布的约束。训练完成后,模型虽然可以根据新观测输出动作,却不知道动作之后世界会怎样变化,也不一定知道在失败之后如何主动恢复。它更像是一个强大的行为预测器,而不是一个能够在物理世界中持续成长的智能体。


下半场要完成的第一步,就是把这种静态策略扩展为交互闭环。机器人不再只是执行离线数据中学到的动作,而是通过自身策略不断生成新经验:

并将这些真实轨迹重新纳入训练过程:

这意味着数据不再只是外部收集的静态样本,而是由机器人自身行为逐渐塑造的经验分布。策略产生数据,数据更新世界模型与价值估计,更新后的模型再反过来改进策略:


这正是交互式学习区别于观察式学习的核心。机器人不再只是从别人如何完成任务中学习,而是在自身行动造成的后果中学习。它既要继承上半场形成的行为先验,也要通过真实环境反馈不断修正并扩展这个先验。


3.2 世界模型:为强化学习提供可预测的未来


世界模型的作用,是把机器人从“看见当前状态并输出动作”推进到“预测动作将如何改变未来状态”。它学习的不是专家在某个观测下采取了什么动作,而是环境在动作作用下如何演化


在真实机器人中,完整物理状态往往不可直接观测,因此更实际的方式是在历史观测、动作、本体感知和触觉信号中学习潜在状态:


并在潜在空间中建模动作条件下的动态变化


对于具身智能而言,世界模型不能被简单理解为视频生成模型。机器人真正需要的不是“下一帧看起来是否逼真”,而是“执行这个动作后,任务是否推进,物体是否稳定,接触是否安全,未来是否仍然可控”。因此,一个面向机器人决策的世界模型,应当同时预测未来状态、任务进展、失败风险和安全约束,即,其中, rt表示预测的任务收益或进展, ct表示碰撞、滑落、卡住等约束或风险。


世界模型与强化学习的关系,在此变得非常直接。强化学习需要通过试错评估哪些动作更好,但真实机器人试错昂贵、缓慢且可能损坏硬件。世界模型提供了一种内部试错空间:机器人可以先在模型中展开若干条“想象轨迹”,预测不同动作序列的后果,再把强化学习的优化过程部分转移到这个内部模型中:

这并不意味着机器人可以完全脱离真实世界。世界模型的预测一定存在误差,尤其是在复杂接触、柔性物体、多物体遮挡和长程任务中,误差会随着时间逐渐累积。因此,世界模型必须不断接受真实交互反馈的校正。它的价值不在于取代真实环境,而在于减少盲目试错,使机器人能够更有选择地探索、更有效地利用有限的真实交互数据。


3.3 强化学习:把预测未来转化为策略改进


如果说世界模型提供的是“可能发生什么”,那么强化学习提供的便是“应该选择什么”。仅仅预测未来并不能自动产生智能行为,因为机器人还需要判断哪个未来更好,哪些失败应当避免,哪些探索值得继续。这个评价与优化机制是强化学习的核心作用。


强化学习的基本目标可以写作:

这个目标与模仿学习的区别在于,模仿学习优化的是动作相似性,而强化学习优化的是结果有效性。机器人不再只是追求“动作是否像专家”,而是追求“这串动作是否真正推进任务,是否稳定、安全、高效”。对于物理任务而言,这一点尤其关键,因为许多任务并不存在唯一正确的专家动作。拿起杯子、打开抽屉、整理桌面或绕过障碍物,都可能存在多种可行策略。强化学习允许机器人发现不同于示范但更适合自身身体结构、传感器条件和执行约束的行为方式。


不过,下半场的强化学习不应被理解为从随机动作开始的盲目试错。上半场已经通过规模化模仿学习提供了可用的基础策略,因此更合理的路径是从预训练策略π0出发进行交互式后训练


这时,强化学习的目标可以加入对原始行为先验的约束:

这个形式表达了下半场强化学习的基本思想:机器人既不能完全抛弃模仿学习得到的通用行为基础,也不能被历史示范锁定。它需要在保持基本行为合理性的同时,根据真实反馈发现更适合当前环境的动作。


强化学习在这里至少补足了三种能力。① 它使失败成为学习信号。滑落、碰撞、卡住和任务中断不再只是分布外异常,而是可以反向更新策略的反馈。② 它处理长程信用分配。许多机器人任务的成功取决于多个动作之间的组合,早期动作会影响后续是否可行,强化学习可以把最终结果反向关联到前面的动作选择。③ 它提供持续适应能力。真实部署环境不是固定测试集,物体、场景、硬件状态和用户偏好都会变化,机器人需要在部署后继续根据反馈调整策略。


因此,强化学习不是对模仿学习的替代,而是对模仿学习的后训练和闭环化。模仿学习让机器人获得“初始会做”的能力,强化学习让机器人获得“越做越会”的机制。


3.4 预测–决策–反馈:下半场的系统形态


世界模型与强化学习结合之后,具身智能的系统形态会从单一基础模型转向闭环智能体。上半场的 VLA 模型通常强调视觉、语言和动作之间的端到端映射;下半场的智能体则需要在行动前预测,在行动中执行,在行动后根据反馈更新,如图4所示。


这个闭环可以写作:,其中, 是已有真实交互数据, 是当前世界模型, 是价值或奖励估计, 是经过强化学习更新后的策略, 则包含新策略在真实环境中产生的新经验。


这个结构说明,三者缺一不可。没有世界模型,强化学习会严重受限于真实交互成本;没有强化学习,世界模型只能预测未来,却不能把预测转化为行动选择;没有真实反馈,世界模型与策略都会逐渐偏离真实物理世界。下半场的关键,不是单独追求更大的策略模型,也不是单独追求更逼真的生成模型,而是建立预测、决策和反馈之间的稳定循环。


面向这一目标,未来的具身智能体至少需要包含几个模块:感知与状态编码器、世界模型、价值或奖励模型、策略模型和安全约束系统。可以概括为

式中, 负责把视觉、语言、本体感知和触觉压缩为可决策状态; 负责预测行动后果;负责评估未来状态的价值;负责约束危险探索以及不可接受行为。负责生成动作;负责约束危险探索以及不可接受行为。

图 4 基于预测-决策-反馈的具身智能下半场核心系统

在这种系统中,视觉-文本-动作基础模型不再是整个机器人的终点,而是策略模块或行为先验的一部分。世界模型负责预测候选动作后果,强化学习负责基于奖励与反馈改进策略,安全模块负责限制探索边界,交互数据则会在数据层面积累跨任务、跨场景和跨部署周期的经验。


因此,下半场的本质,是从规模化离线预训练走向规模化交互式后训练。上半场证明机器人可以通过大规模数据获得通用行为基础;下半场要证明的是,机器人能否在真实物理世界中持续生成经验、预测后果、优化决策,并修正自身能力。


如果说上半场让机器人获得了“会做事”的初始能力,那么下半场真正要形成的是“在做事中变得更会做”的成长机制。只有当机器人能够完成感知、预测、决策、行动、反馈和更新的闭环时,具身智能才真正从模仿智能走向物理智能。


4 总结


近年来,规模化模仿学习与视觉-语言-动作模型的发展,使机器人首次展现出类似基础模型的能力获取路径:通过大规模、多任务、多场景示范数据学习通用行为先验,并在一定程度上实现跨任务、跨场景和跨对象的泛化。这一进展为通用具身智能提供了重要起点。然而,通向通用物理智能的道路不能停留在离线行为拟合。模仿学习能够让机器人学习“专家在类似情境下通常如何行动”,却难以充分回答“某个动作将如何改变世界”以及“当行动结果偏离预期时应如何修正”。在开放物理环境中,分布偏移、复杂接触、长程任务依赖、异常失败状态和安全约束并非偶然困难,而是数据驱动范式面临的结构性边界。单纯扩大示范数据规模可以提升行为覆盖范围,却无法替代机器人在真实环境中通过行动获得反馈、通过反馈修正策略,并通过持续交互扩展能力的过程。面向这一边界,具身智能需要从规模化离线预训练进一步走向规模化交互式后训练。世界模型为机器人提供对行动后果的预测能力,使其能够在执行前推演不同动作可能带来的未来状态;强化学习则将环境反馈转化为策略优化信号,使机器人能够围绕长期任务目标、安全约束和失败恢复不断改进行为。二者与大规模模仿学习并非替代关系,而是递进关系:模仿学习提供初始行为先验,世界模型提供动态预测能力,强化学习提供闭环优化机制,真实环境反馈则不断校正并扩展整个系统。因此,未来具身智能的核心不应只是训练更大的离线策略模型,而应是构建能够在感知、预测、决策、行动、反馈和更新之间持续循环的闭环物理智能体。只有当机器人不再只是历史经验的复现者,而能够在与世界的互动中不断产生新经验、理解行动后果,并改进自身策略时,具身智能才可能真正从模仿智能走向物理智能。


暂无评论,等你抢沙发

  • 短信登录
  • 密码登录
还没有账号,
登录即代表您同意本网站的 《用户注册协议》
还没有账号,
登录即代表您同意本网站的 《用户注册协议》
注册
已有账号, 立即登录
登录即代表您同意本网站的 《用户注册协议》
找回密码