导语
过去三年,机器人操作的数据几乎全部来自遥操作——人戴 VR 头显、用手柄或主从臂操控真实机器人完成任务。这条路线的产出质量最高,但产能有物理上限:单台机器人每天理论上限 24 小时,实践中稳定采到 3 小时已属理想,且设备维护、复位、故障不断侵蚀有效时间。2026 年,两条替代路径被同时验证:UMI/DexUMI 一类"把机器人末端穿在人手上"的穿戴式采集,以及更进一步的、双手无需任何装备的第一视角人类视频采集。NVIDIA 的 EgoScale 用 2.1 万小时第一视角人类数据预训练、仅用 4 小时遥操数据微调,就把策略泛化到整理扑克牌、操作注射器、精准转移液体等灵巧任务——遥操作在训练混合中的占比掉到 0.1% 以下。
技术要点
三级可扩展性阶梯。 按"与机器人硬件的对齐程度"与"可扩展规模"两个维度,数据采集方式可划分为三级:
| 层级 | 方式 | 对齐度 | 可扩展规模 | 代表 |
|---|---|---|---|---|
| 第一级 | 真机遥操作 | 最高 | 单台约 3 小时/天 | VR 主从臂、外骨骼 |
| 第二级 | 穿戴式采集 | 中 | 数十万小时级 | UMI、DexUMI、各类数据手套/夹爪 |
| 第三级 | 第一视角人类视频 | 低 | 千万小时级 | EgoScale、Ego-Centric 众包采集 |
EgoScale 的关键数字。 在 2.1 万小时真实世界第一视角人类数据上预训练(零机器人数据,预训练阶段预测手部关节与手腕姿态),动作微调阶段仅用 50 小时高精度动捕手套数据 + 4 小时遥操数据(不到训练混合的 0.1%),得到端到端策略,可直接从相机像素映射到 22 个自由度的灵巧机器人手;在折衬衫类任务上,测试时仅需一次示范即可学会新策略。
灵巧性的 scaling law 首次出现。 该工作最重要的发现是预训练小时数与最优验证损失之间呈干净的 log-linear 关系——距离语言模型首次发现神经 scaling law 已过去六年,机器人终于有了自己的那条曲线。这意味着"投入更多第一视角数据"第一次有了可预测的回报曲线。
采集现场的质量引导。 上海交大等团队的 EgoGuide(arXiv 2606.14665)指出纯腕部相机方案的两个瓶颈:示范者不知道哪些状态已被覆盖、哪些仍稀缺,导致大量冗余轨迹(UMI 有时需要 5 倍以上 episode 才能达到与遥操相当的成功率);单一腕部相机视野过窄,遮挡下观测不充分。其解法是在手持采集上增加同步的头戴第一视角观测与 AR 在线覆盖度评分,在录制前引导示范者调整手位、物体摆放与视角;策略侧用门控第一视角残差策略(GERP),以腕部视角为稳定基座、头部视角按需修正。
能力差距被量化。 RoboDojo 由香港大学多媒体实验室联合 UC Berkeley、清华大学等近 20 所机构发起,设 42 项仿真任务 + 18 项真机任务,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五维度。2026 年 7 月首批榜单中,仿真头部模型平均成功率仅 8.80%、真机最高 12.8%,人类专家分别为 76.03% 与 100%;8 月 25 日更新后,登顶模型综合 24.90、平均成功率 19.34%,"记忆"维度 47.74 分、第二名仅 13.37 分。
关键突破
- •遥操在训练混合中的占比降至 0.1% 量级,数据供给的物理上限被打破。
- •灵巧性 scaling law 首次被观测,数据投入回报从"经验"变为"可预测"。
- •最优观测配置趋于收敛:头戴第一视角(全局上下文)+ 腕部视角(稳定基座)的同步组合,被多篇工作独立验证为当前最优。
- •采集端质量引导成为新方向:把覆盖度评分前移到录制前,把"事后筛"变成"事中导",直接提升单位小时的有效数据率。
对产业的影响
第一,数据供给从"项目制"转向"产能制"。当配比走向"90% Ego + 10% 真机"(部分团队探索 99:1),竞争要素变成单位小时成本、数据有效率、质量一致性与合规可交付性——这四项全部由采集硬件与流程工程决定,而非算法。
第二,设备厂商的价值锚点从"卖相机"转向"卖每小时有效数据"。有效数据成本 = 采集小时成本 ÷ 有效率;有效率从 40% 提升到 75% 时,单位成本几乎减半。
第三,"记忆/长程"成为数据集的新差异化维度。榜单显示模型的主要短板在记忆与长程一致性,这要求采集任务设计必须包含多阶段、带明确子目标结构的长程样本,而非大量短程成功轨迹。
第四,合规与可追溯进入采购前置条件。众包采集涉及人脸、车牌与商业空间,大厂采购流程中法务审查通常先于技术验证。
配图建议
图 1(放置:导语之后)
- •画面描述:三级可扩展性阶梯散点图。横轴"与机器人硬件的对齐程度",纵轴"可扩展规模(对数刻度)";三个圆点由左下向右上排列,圆的面积依次增大:遥操(约 3 小时/天)、穿戴式(数十万小时)、第一视角视频(千万小时)。三个点之间画一条虚线,左侧标注"传统范式"、右侧标注"Sensorized Human Data"。
- •图注:图 1|数据采集的三级可扩展性阶梯:对齐度与规模不可兼得,取舍决定数据成本结构。
图 2(放置:"技术要点"中 EgoScale 段落后)
- •画面描述:EgoScale 训练配比环形图。整圆代表训练混合,其中第一视角人类数据(2.1 万小时)占 99.9% 以上,动捕手套 50 小时与遥操 4 小时合并为一条极窄的扇形(<0.1%),并用引线放大标注。右侧配一条 log-linear 曲线:横轴预训练小时数、纵轴验证损失,标注"灵巧性 scaling law"。
- •图注:图 2|EgoScale 的训练配比与首次观测到的灵巧性 scaling law(数据引自 ICML 2026 论文)。
图 3(放置:"对产业的影响"第二条之后)
- •画面描述:有效数据成本公式图示:有效数据成本 = 采集小时成本 ÷ 有效率。下方两栏对照:左栏"事后筛"(采集 → 清洗 → 标注 → 训练,有效率 30–50%,大量数据被丢弃,用灰色块表示);右栏"事中导"(采集时 AR 实时覆盖度提示 → 标注 → 训练,有效率 70%+,丢弃块明显变小)。两栏底部对比单位成本条。
- •图注:图 3|把质量引导前移到采集现场,可将单位有效数据成本压缩近半(有效率区间为经验值,属估算)。
来源与时间
- •EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data(ICML 2026,NVIDIA);2.1 万小时预训练、50 小时动捕 + 4 小时遥操微调、22 DoF。
- •UMI: In-The-Wild Robot Teaching Without In-The-Wild Robots(RSS 2024);DexUMI 外骨骼方案(NVIDIA,2025–2026 公开演示)。
- •EgoGuide(arXiv 2606.14665,上海交大等,2026)。
- •RoboDojo 榜单(2026-07 首批 / 2026-08-25 更新)。
- •Jim Fan《Robotics: End Game》演讲(红杉 AI Ascent 2026):三级阶梯与"Sensorized Human Data"提法。
标注说明:"90% Ego + 10% 真机"为行业通行经验区间,不同团队差异较大;有效率 30–50% 与 70%+ 为经验估算,属推测性区间,应以自身采集统计为准。