摘要
具身视觉领域过去三年最稳固的共识是"数据规模决定上限"。但这句话在实践中经常被误用为"只要继续采集就会变好",而忽略了数据配比、质量分布、标注结构与评测协议这四个同时起作用、且往往更具杠杆的变量。事实上,多个公开复现研究都观察到:在混合数据集上盲目增加数据量,可能导致目标本体性能下降;而精心设计的数据课程(data curriculum)与质量加权,可以在不增加一小时采集量的前提下带来显著收益。本文系统梳理具身视觉数据的训练方法论:从数据配比与课程设计、标注结构与元数据规范、训练配方(骨干选择、增强、多阶段训练),到评测体系(离线指标、仿真基准、真机评测、长期平台)与数据质量标准化进展。核心判断是:具身智能的数据竞争,正在从"谁的数据更多"转向"谁的数据更可计算地有效",而这一转变的胜负手在于评测与元数据标准。
配图位置 1(摘要之后)|图像内容:四变量雷达图或权重条形图:数据规模、数据配比、质量分布、标注结构,四个变量对最终性能的贡献权重示意;"数据规模"权重低于直觉预期,"配比"与"质量"权重更高。图注要求:图 1|性能贡献的四个变量:规模是最显眼的一个,但不是权重最大的一个。
一、问题背景:规模叙事的三个盲点
盲点一:规模与性能的非线性与负迁移。 直觉上数据越多越好,但混合来自不同本体、不同控制频率、不同相机布局、不同任务分布的数据时,负迁移(negative transfer)是真实存在的。具体表现为:加入大量分布不匹配的旧数据后,目标本体上的成功率反而下降。原因是策略需要同时拟合多个动力学与视觉分布,容量被稀释。
盲点二:数据的"有效量"与"名义量"差距巨大。 一小时连续采集的长程任务数据,与一小时切碎成 600 条独立短片段的数据,其训练价值完全不同。同样标注为"1000 小时"的两个数据集,实际可用于训练的有效信息量可能相差数倍。当前行业普遍用"小时数"作为唯一计价与比较单位,这一指标正在迅速失效。
盲点三:评测与训练目标的错位。 模型在离线指标(如深度 RMSE、检测 mAP)上的提升,与真机任务成功率的提升之间相关性很弱。一个在评测集上提升 5% 的深度模型,用在抓取任务上可能毫无变化,因为成败取决于接触区的局部几何,而非全局平均误差。
这三个盲点共同指向一个结论:需要一套能计算"数据有效性"的方法论,而不是依赖规模直觉。
配图位置 2(第一节末尾)|图像内容:负迁移示意图:横轴为"加入的分布外数据量",纵轴为目标任务成功率;曲线先小幅上升后明显下降,标注"正迁移区""负迁移区"与"最优点",并叠加另一条曲线显示"带质量加权后"的曲线下降被显著抑制。图注要求:图 2|负迁移与质量加权:盲目的规模扩张存在最优点。
二、核心技术路径
2.1 数据配比与课程设计
处理混合数据的主流方法有三类。其一是来源加权:为不同来源的数据分配采样权重,权重可以通过小规模验证集上的消融确定,也可以用"与目标任务的分布距离"自动估计。其二是课程学习:先在与目标任务最接近的数据上训练,逐步引入分布更远的数据,避免早期被噪声分布主导。其三是质量过滤与重标注:用模型(如成功率预测器、一致性检测器)自动剔除低质量轨迹,或对低质量部分重新标注。
一个实践中的关键细节是:验证集必须与真实目标分布一致。如果用混合分布做验证,就无法发现负迁移。
2.2 标注结构与元数据:决定数据"可被怎么用"
标注的层次直接决定数据的用途上限。可以区分为四个层级:L0 原始视频(只能做自监督预训练)、L1 + 时间同步与相机参数(可做几何任务与跨本体对齐)、L2 + 位姿/深度/分割/可供性(可做监督式几何与操作学习)、L3 + 任务结构、成败标签、失败模式、语义摘要(可做离线 RL、记忆检索、质量课程)。
当前公开数据集中,绝大多数停留在 L0—L1,少量达到 L2,达到 L3 的极少。RoboMIND 2.0 是少数同时提供触觉、力与失败标签的数据集(约 31 万条轨迹、1000+ 小时、739 个任务、6 种本体),其价值正在于此而非规模。
2.3 训练配方:骨干、增强与多阶段
骨干选择:通用视觉骨干(DINOv2、CLIP 类)提供语义与结构先验;三维原生骨干(如 VGA,arXiv 2604.12908)在需要空间推理的任务上更有优势。实践共识是:骨干质量的影响通常超过下游算法选择,且冻结骨干 + 轻量适配头在小数据场景下往往优于全量微调。
数据增强:具身视觉的增强不只是色彩抖动,更应包括:视角扰动(模拟相机位姿变化)、时序裁剪与重采样(应对控制频率差异)、工况退化增强(粉尘、模糊、反光)、以及物体外观随机化(提升跨物体泛化)。针对工况的增强收益通常超过换骨干,这一点在多个工业实践中被反复验证。
多阶段训练:主流范式是"大规模预训练 → 域内继续预训练 → 任务微调 →(可选)RL 微调"。每个阶段的数据配比与学习率策略都需要独立调优。
2.4 评测体系:从离线指标到长期平台
评测的层次分为四级:离线指标(深度误差、位姿误差、分割 mIoU)——廉价但与任务弱相关;仿真基准(LIBERO 130 任务、CALVIN、ManiSkill、BEHAVIOR-1K)——可复现但存在过拟合风险;真机评测——可信但成本高、方差大;长期评测平台(如 RoboDojo,42 项仿真 + 18 项真机,5 个维度)——通过持续更新抑制过拟合,是评测体系的最新形态。
需要强调的是:真机评测的方差远大于论文报告的差值。同一策略在不同初始位姿、不同操作员演示、不同时段光照下,成功率有显著的波动;因此"提升 3 个百分点"在多数真机设置下不具备统计显著性。报告真机结果时应给出多次试验的分布而非单点。
配图位置 3(第二节末尾)|图像内容:评测四层金字塔:底层离线指标(成本低、相关性低)→ 仿真基准 → 真机评测 → 顶层长期平台(成本高、相关性强);右侧标注每层的成本量级与过拟合风险。图注要求:图 3|评测的四层结构:越往上越贵,也越接近真实价值。
三、代表数据集与基准对比
| 数据集/基准 | 规模 | 本体/任务 | 模态与标注层级 | 主要用途 |
|---|---|---|---|---|
| Open X-Embodiment | 约 140 万条轨迹 | 22 种本体、527 项技能、311 场景 | 主要为轨迹,L1—L2 | 跨本体预训练 |
| AgiBot World | 100 万+ 条轨迹 | 217 任务、3000+ 物体 | 轨迹,L1—L2 | 大规模操作预训练 |
| RoboMIND 2.0 | 约 31 万条、1000+ 小时 | 739 任务、6 种本体 | 含触觉、力与失败标签,L3 | 鲁棒策略、离线 RL |
| DROID | 76k 条、350 小时 | 564 场景、86 任务 | 3 路立体视觉、15 Hz,L1—L2 | 跨场景泛化 |
| Humanoid Everyday | 约 1.03 万条 | 260 任务 | 人形第一人称,L1—L2 | 人形操作 |
| BridgeData V2 | 约 6 万条 | 多任务 | 轨迹,L1 | 跨领域迁移 |
| RH20T | 约 11 万条 | 多任务 | 含力/触觉通道,L2 | 多模态操作 |
| LIBERO / CALVIN / ManiSkill | 仿真基准 | 130 / 长程 / 多样 | 仿真,L2 | 算法横向比较 |
| BEHAVIOR-1K | 1000 项活动 | 场景级 | 仿真 + 真实扫描,L2 | 长程日常活动 |
| RoboDojo | 42 仿真 + 18 真机,5 维度 | 持续更新 | 评测平台 | 防过拟合的长期评测 |
注:规模数据来自各数据集官方公开披露,统计口径不同(轨迹数 vs 小时数 vs 任务数),不可直接比较;标注层级(L0—L3)为本文提出的主观分层,非行业标准。
四、挑战与趋势
挑战一:数据质量标准的缺位。 2026 年之前,具身数据缺乏统一的质量标准,"1000 小时"无法说明数据是否可用。这一局面正在改变:工信部已批准 YD/T 6771-2026 行业标准(2026 年 7 月批准,2026 年 11 月 1 日实施,由中国信通院联合 40 余家单位制定,提出完整性、一致性、多样性、真实性、易用性、实用性、可扩展性、安全性共 8 项质量指标)。标准的落地将重塑数据交易的定价基础。
挑战二:真机评测的统计功效不足。 多数真机实验的样本量太小,无法支撑其报告的性能差异。这一问题的系统性解决需要共享的真机评测设施与标准化协议。
挑战三:数据资产的可持续更新。 数据会随硬件迭代、任务定义变化与算法进步而折旧。如何设计"可重新加工"的数据架构(保留原始数据 + 可重新生成的中间结果),是数据资产的长期价值问题。
趋势一:从"小时数"转向"有效量"。 数据卡将逐步包含时长之外的质量维度(同步精度、标定残差、失败标签比例、标注层级)。
趋势二:数据金字塔成为资源配置框架。 真机数据(最贵最准)→ UMI/穿戴式数据(中)→ 人类第一人称视频(廉价量大)→ 仿真数据(极廉价)→ 网络视频(最廉价最弱)的五层结构,正在成为行业通用的资源配比模型。
趋势三:失败样本的价值被重新认识。 只在成功轨迹上训练的策略遇到分布外状态时必然失控;失败与恢复数据从"废料"变成"稀缺资源"。
配图位置 4(第四节末尾)|图像内容:数据金字塔五层图(真机 / UMI-穿戴 / 人类第一视角 / 仿真 / 网络视频),每层标注单位成本与信息密度,右侧用箭头标注"最优配比为倒金字塔:底层量大廉价、顶层量少昂贵但关键"。图注要求:图 4|数据金字塔:资源配置的核心不是总量,而是各层的比例。
五、落地建议
- 1.建立与目标分布一致的验证集。 这是发现负迁移与指导数据配比的唯一可靠手段,优先级高于扩大数据规模。
- 2.先做数据课程,再买数据。 在既有数据上做配比与课程实验,通常能以零采集成本获得可观收益;做完这一步再判断该买什么数据。
- 3.为数据标注建立分层规范。 明确每批数据处于 L0—L3 的哪一层,并在数据卡中标注。避免用 L0 的价格买 L0 却按 L2 的预期使用。
- 4.把失败样本纳入采集计划并标准化标注。 失败类型(打滑、碰撞、位姿偏差、物体损伤)、失败发生时刻、是否有恢复行为,这三个字段成本极低但价值极高。
- 5.真机评测必须报告分布与样本量。 给出多次试验的均值与方差、初始条件分布、以及置信区间;拒绝用单点数字支撑结论。
- 6.采用至少一个长期评测平台作为外部标尺。 内部基准容易过拟合,外部持续更新的平台能提供相对客观的位置感。
六、对拓比科技的可执行启示
- •硬件侧:数据的"有效量"首先由硬件决定。µs 级同步、全局快门、全温标定、刚性基线,这些硬件特性直接决定数据处于 L1 还是 L0。把硬件指标与数据层级明确对应(例如"达到某同步精度才能支撑 L2 级深度标注"),是把硬件优势转化为数据溢价的关键叙事。
- •数据侧:把 YD/T 6771-2026 的 8 项质量指标做成内部数据卡的默认字段。该标准将于 2026 年 11 月 1 日实施,提前对齐意味着在标准落地时即具备合规优势。更进一步,可为每批数据出具"质量评分",把不可比的数据变成可定价的商品——这是数据供应商最有可能建立壁垒的位置。
- •生态侧:参与并推动数据卡的字段标准化(同步精度、标定残差、标注层级、失败标签比例、单条轨迹时长分布)。在标准形成期主动定义字段,比标准确定后被动适配,成本低一个数量级而收益高一个数量级。
配图位置 5(全文末尾)|图像内容:价值迁移路径图:左侧"按小时定价"(同质化、价格战),中间"+ 质量指标"(可比较、溢价),右侧"+ 质量标准与合规认证"(可定价、形成壁垒);箭头表示行业演进方向,标注 YD/T 6771-2026 作为中间到右段的政策驱动。图注要求:图 5|从卖小时到卖标准:数据供应商的价值跃迁路径。
来源与时间
Open X-Embodiment(约 140 万条轨迹、22 种本体、527 项技能、311 个场景);AgiBot World(100 万+ 条轨迹、217 任务、3000+ 物体);RoboMIND 2.0(约 31 万条轨迹、1000+ 小时、739 任务、6 种本体,含触觉、力与失败标签);DROID(76k 条、350 小时、564 场景、86 任务、3 路立体、15 Hz);Humanoid Everyday(约 1.03 万条、260 任务);BridgeData V2(约 6 万条);RH20T(约 11 万条);LIBERO(130 任务)、CALVIN、ManiSkill、BEHAVIOR-1K(1000 项活动);RoboDojo(约 20 家机构,42 项仿真 + 18 项真机,5 个维度;2026 年 7 月头部 8.80% vs 人类 76.03%,真机最高 12.8% vs 100%;2026-08-25 DM0.5 综合 24.90、平均 19.34%、记忆 47.74 vs 第二名 13.37);VGA(arXiv 2604.12908);YD/T 6771-2026(工信部 2026 年 7 月批准,2026 年 11 月 1 日实施,中国信通院联合 40 余家单位,8 项质量指标:完整性、一致性、多样性、真实性、易用性、实用性、可扩展性、安全性);中国信通院《具身智能训练场研究报告(2026)》(全国已建/在建训练场 70 余个)。
标注:数据集规模来自官方公开披露,统计口径不同不可直接比较;L0—L3 标注分层为本文主观提出,非行业标准;对"负迁移存在最优点""数据竞争转向有效性"的判断属于前瞻研判与工程经验推断;行业标准的具体条款以正式发布文本为准。