返回新闻与洞察
视觉算法专项

视觉强化学习:当模仿学习的天花板被数据规模撞到之后

过去三年,具身操作的主流范式是模仿学习——采集人类遥操作轨迹,做行为克隆或扩散策略。这条路径在结构化任务上取得了令人瞩目的进展,但它有一个由数据分布决定的硬天花板:策略的性能上界被示范者的水平与示范覆盖的状态分布所…

2026-09-08
拓比科技视觉算法团队
视觉算法专项
SLAM 精度验证与位姿轨迹评估

摘要

过去三年,具身操作的主流范式是模仿学习——采集人类遥操作轨迹,做行为克隆或扩散策略。这条路径在结构化任务上取得了令人瞩目的进展,但它有一个由数据分布决定的硬天花板:策略的性能上界被示范者的水平与示范覆盖的状态分布所限制。策略只能学到数据中出现的恢复行为,一旦执行误差把它带到分布外状态,就会失控且无法挽回。视觉强化学习(visual RL)的理论吸引力正在于此:通过与环境交互自主产生数据,它可以探索示范之外、甚至优于示范的行为。但视觉 RL 的样本效率、安全性与奖励设计问题长期阻碍其在真机上的应用。2025—2026 年出现的变化是:世界模型与仿真到实机迁移的成熟、离线 RL 与离线到在线(offline-to-online)范式的普及,正在把视觉 RL 从"理论正确但不可用"推向"特定场景可用"。本文梳理视觉 RL 的技术路径、与模仿学习的融合方式、代表工作对比与落地建议。

配图方案

配图位置 1(摘要之后)|图像内容:两条性能增长曲线,横轴为数据量(对数轴)或交互步数;模仿学习曲线在示范者水平处渐近饱和,视觉 RL 曲线起步更低但最终超过示范水平并持续上升,两线交汇处标注"交叉点"。图注要求:图 1|模仿学习的天花板与强化学习的后发优势:交叉点位置决定技术选择。

一、问题背景:模仿学习的三个结构性缺陷

缺陷一:分布偏移的复合误差。 行为克隆训练的策略在推理时,任何一步的小误差都会把它带到训练分布之外的状态;由于没有纠正信号,误差逐步复合,最终导致灾难性偏离。这是经典的 DAgger 问题,在连续控制的高维视觉输入下尤其严重。

缺陷二:示范质量的硬上限。 策略最多学到示范者的水平。如果遥操作员的作业节拍是 12 秒/件,那么纯模仿的策略不会自动更快——它没有优化目标去追求更快。

缺陷三:失败恢复数据的稀缺性。 人类示范绝大多数是成功的。策略因此从未见过"接近失败的边缘状态"以及"如何从中恢复",而恰恰是这部分数据对鲁棒性的贡献最大。采集失败恢复数据需要人为制造错误,成本高昂且难以覆盖。

视觉 RL 提供了另一种可能性:让机器人在环境中自主试错。理论上它可以探索出比人类更优的策略,并自动生成恢复行为。但真机 RL 面临三重障碍:样本效率(需要百万级交互步)、安全性(探索过程中的碰撞与损坏)、奖励可获取性(很多任务难以用传感器自动判定成功)。

配图方案

配图位置 2(第一节末尾)|图像内容:状态空间示意图,训练分布(灰色椭圆)与推理时的实际访问分布(红色轨迹)逐渐偏移,标注偏移发生的关键节点与恢复行为缺失区。图注要求:图 2|分布偏移:策略失控的几何解释,恢复行为的缺失是致命环节。

二、核心技术路径

2.1 表征学习先行:把视觉压缩成可学习的状态

在高维图像上直接做 RL 几乎不可行。主流做法是先学一个紧凑的视觉表征,再在表征空间做 RL。常用技术包括:对比学习(如 CURL 类方法)、重建式表征、数据增强驱动的正则化(如 DrQ 系列的随机偏移增强),以及复用大规模预训练视觉模型(DINOv2、CLIP、以及 2026 年出现的三维原生骨干如 VGA)的冻结特征。

工程上一个重要共识是:表征的质量比 RL 算法的选择更决定最终性能。在相同的 RL 算法下,换一个更好的预训练骨干带来的提升,往往超过从 SAC 换到 TD3 或 PPO 的收益。

2.2 离线 RL 与离线到在线范式

真机交互昂贵,因此离线 RL(从已有静态数据集学习策略,不与环境交互)成为折中方案。代表算法包括 CQL、IQL、BCQ 等。离线 RL 的吸引力在于可以复用已有数据集;其缺陷是策略性能同样受数据覆盖限制,且对分布外动作的价值估计容易发散。

更有前景的是离线到在线(offline-to-online)范式:先用离线数据预训练,得到一个安全可用的初始策略,再用少量真机交互微调。这既保留了数据效率,又突破了纯离线的性能天花板,同时因为初始策略已经"可用",探索过程中的安全风险大幅降低。这是当前真机 RL 最务实的路径。

2.3 仿真中的大规模 RL + 迁移

当任务可以在仿真中建模时,最高效的路径是:在仿真中用海量并行环境做 RL(如 Isaac Gym 类的大规模并行仿真可达数万环境并行),然后通过域随机化与系统辨识迁移到真机。这条路线的样本效率问题被仿真彻底解决,瓶颈转移到仿真与现实的差距(sim-to-real gap)。视觉层面的差距(纹理、光照、反射)可以通过域随机化缓解;物理层面的差距(接触力学、摩擦、柔性体)则困难得多。

2.4 世界模型作为可微分的"想象环境"

2025—2026 年最显著的变化是世界模型的成熟。如果有一个可以预测"执行动作 a 后观测会变成什么样"的生成式模型,那么 RL 可以在模型内部做想象rollout,而不消耗真机交互。代表工作包括 Dreamer 系列、TD-MPC 系列,以及 2026 年的 WAM(NVIDIA DreamZero 相关工作)、DreamDojo(ICML 2026)、PEVA(NeurIPS 2025,LeCun 参与)、Genie Envisioner(ICLR 2026 周期)等。

需要保持清醒的是:也有工作对世界模型的必要性提出质疑(如 Fast-WAM,arXiv 2026),指出在特定任务上直接用大规模模仿数据训练的策略已经足够好,世界模型带来的边际收益不足以抵消其训练与推理成本。这是一场尚未有定论的争论。

配图方案

配图位置 3(第二节末尾)|图像内容:四条技术路径的决策流程图,根据"能否仿真建模""是否已有大规模数据集""真机交互预算"三个判断,导向离线 RL / 离线到在线 / 仿真 RL+迁移 / 世界模型 RL。图注要求:图 3|视觉 RL 的路径选择:没有通用最优解,取决于约束条件。

三、代表工作对比

类别代表算法/工作核心机制样本效率真机可行性主要瓶颈
在线视觉 RLCURL、DrQ、DrQ-v2对比/增强表征 + SAC低(百万步级)交互成本
离线 RLCQL、IQL、BCQ保守价值估计无需交互受数据覆盖限制
离线到在线Off2On 类方法、Cal-QL离线预训练 + 在线微调较高微调期安全
仿真 RL + 迁移Isaac Gym/Isaac Lab 大规模并行域随机化 + 系统辨识高(仿真无限)高(间接)sim-to-real gap
基于模型Dreamer 系列、TD-MPC 系列潜空间想象 rollout较高模型误差累积
世界模型驱动WAM/DreamZero、DreamDojo(ICML 2026)、PEVA(NeurIPS 2025)、Genie Envisioner生成式未来预测取决于模型质量中—高训练成本与保真度
直接模仿(对照)扩散策略、ACT、VLA行为克隆无需交互受示范上限约束

:效率与可行性分级为本文主观评估;各工作的量化指标来自原始论文,评测环境不同不可直接比较

四、挑战与趋势

挑战一:真机奖励信号的获取。 多数工业任务缺乏自动的成功判定。视觉奖励学习(从少量成功示例学一个奖励分类器)是一个方向,但分类器本身的误差会被 RL 利用(reward hacking)。

挑战二:探索过程的安全性。 即使初始策略已经可用,微调阶段的探索仍可能造成碰撞。需要安全约束层(如控制屏障函数、动作空间裁剪、人工接管机制)。

挑战三:仿真中的"物理作弊"。 仿真 RL 常会找到仿真器物理引擎的漏洞(如利用穿透、异常摩擦),这些策略迁移到真机后完全失效。识别与防范这类作弊需要跨仿真器验证。

趋势一:世界模型 + 离线到在线 的组合成为主流。 世界模型提供廉价 rollout,离线数据提供安全起点,在线微调突破上界。

趋势二:RL 与模仿的界限模糊化。 现代方法普遍采用"模仿预训练 + RL 微调"的两阶段范式,纯粹的 RL from scratch 在真机上已不现实。

趋势三:真实世界 RL 的评测标准化。 随着 RoboDojo 等长期评测平台的出现(2026 年 7 月头部系统 8.80% 对比人类 76.03%,真机最高 12.8% 对比人类 100%),RL 算法的真实进展终于有了可比的标尺。

配图方案

配图位置 4(第四节末尾)|图像内容:两阶段范式流程图:大规模模仿预训练 → 世界模型想象 rollout → 安全约束下的在线微调 → 持续评测;标注每阶段的成本与风险等级。图注要求:图 4|2026 年的主流范式:模仿打底、模型想象、安全微调。

五、落地建议

  1. 1.不要从零做真机 RL。 先用模仿学习得到一个可用基线,再考虑 RL 微调,这是唯一务实的路径。
  2. 2.优先投资表征而非算法。 选择更强的预训练视觉骨干(含三维原生骨干),收益通常超过更换 RL 算法。
  3. 3.为 RL 微调准备"安全气囊"。 动作空间裁剪、速度限制、力矩上限与一键接管,这些是 RL 上真机的前置条件,不是可选配置。
  4. 4.在数据中主动纳入失败与恢复片段。 哪怕不采用 RL,这部分数据对离线 RL 与鲁棒模仿学习都有显著价值。
  5. 5.建立自动化的成功判定。 无论采用哪条路线,可自动化的任务成功判定都是规模化训练的前提;没有它,RL 与大规模评测都无从谈起。
  6. 6.用小规模的真机验证代替大规模仿真指标。 仿真性能的提升必须定期用真机任务校验,否则容易陷入"仿真刷分"的陷阱。

六、对拓比科技的可执行启示

  • 硬件侧:RL 微调与在线评测要求设备能长时间稳定工作,并在不同批次间保持一致的标定与同步。设备的可重复性(同一任务重复采集的一致性)比峰值指标更重要——RL 的数据来自同一设备的多次尝试,设备本身的方差会直接污染学习信号。
  • 数据侧失败样本与恢复行为是最稀缺的资产。当前公开数据集中系统标注失败模式的极少(RoboMIND 2.0 是少数同时提供触觉、力与失败标签的数据集,约 31 万条轨迹、1000+ 小时、739 个任务、6 种本体)。把失败模式做成标准化标注字段,是明确且稀缺的差异化点。
  • 生态侧:提供可复现的"任务成功判定"参考实现。如果数据交付时同步给出一个可运行的成功判定脚本或判据规范,客户做 RL 微调的门槛会大幅下降——这属于典型的"卖铲子"型生态投入。
配图方案

配图位置 5(全文末尾)|图像内容:双轴图,横轴为数据集的"结构化程度"(原始视频 → 位姿配套 → 含失败标注 → 含成败判定规范),左轴为"客户可直接用于 RL 的比例",右轴为"单位小时数据价值",两条曲线同步上升。图注要求:图 5|失败标注与判定规范:把数据从训练语料升级为 RL 可用的资产。

来源与时间

CURL(2020)、DrQ / DrQ-v2(2020—2021);CQL(2020)、IQL(2021)、BCQ(2018);Cal-QL 与 offline-to-online 系列(2022—2024);Dreamer 系列与 TD-MPC 系列(2020—2025 持续演进);Isaac Gym / Isaac Lab 大规模并行仿真;世界模型相关工作:PEVA(NeurIPS 2025,LeCun 参与)、DreamDojo(ICML 2026)、Genie Envisioner(ICLR 2026 周期)、WAM / NVIDIA DreamZero(2026)、Fast-WAM(arXiv 2026,对世界模型必要性提出质疑);RoboDojo 长期评测平台(2026 年 7 月头部系统 8.80% vs 人类 76.03%,真机最高 12.8% vs 100%);RoboMIND 2.0(约 31 万条轨迹、1000+ 小时、739 个任务、6 种本体,含触觉、力与失败标签);VGA(arXiv 2604.12908,三维原生骨干,LIBERO 上达 SOTA)。

标注:上述数值来自各论文与平台公开披露,评测协议不同不可直接比较;对"表征质量收益高于算法选择""两阶段范式将成为主流"的判断属于前瞻研判;RoboDojo 数据为平台当期快照,随时间更新。