导语
具身智能的数据供给正在形成两条相互支撑的腿:一条是来自真实世界的第一人称(Ego)多模态数据,它提供物理真实性与规模潜力;另一条是仿真平台与评测基准,它提供可控性、可复现性与强化学习所需的海量环境。2026 年的变化在于:这两条腿开始咬合——第一人称数据为仿真提供真实场景与任务分布,仿真把第一人称数据放大为可交互环境,而评测基准则为两者提供共同的尺子。对数据供应商而言,理解这套咬合关系,比单纯比拼数据规模更重要。
技术要点
第一人称数据:从视频到可计算结构。 早期 Ego 数据(如 Ego4D 一类)主要是未标注的长时间视频,可用性有限。2026 年的关键进展是把 Ego 视频转化为带结构的训练信号:EgoTSR(ICML 2026)构建约 4600 万样本的第一人称数据集,用三阶段课程训练模型判断任务进度,长程逻辑推理达 92.4%、细粒度感知 88.2%,并用双向帧对消除"时间顺序偏差";EgoScale(ICML 2026)用 2.1 万小时第一视角人类数据预训练,仅 4 小时遥操微调即可实现灵巧操作;VITRA(微软亚洲研究院)把无结构人类视频自动转化为与机器人数据格式一致的 VLA 训练数据(三维手部重建 → 原子动作切分 → 语言指令与轨迹生成)。
多模态扩展:触觉加入第一人称。 戴盟机器人 2026 年 4 月联合多机构发布 Daimon-Infinity 全模态数据集,规模达百万小时级,覆盖 80 余个真实场景、2000 余项人类技能,其中 1 万小时开源;其视触觉路线把触觉转为图像格式,从而接入现有视觉框架,并提出把 VLA 扩展为 VTLA(Vision-Tactile-Language-Action)。
仿真平台:五强格局。 主流平台各有定位:NVIDIA Isaac(Isaac Sim 基于 Omniverse,支持合成数据生成与软件在环测试;Isaac Gym 专注 GPU 加速物理模拟,单 GPU 可同时训练数千实例)、MuJoCo(广义坐标模拟、接触优化稳健,支持粒子/布料/绳索/软体)、PyBullet、SAPIEN、Genesis。配套数据集包括 BEHAVIOR-1K(1000 个日常活动)、CALVIN(长时域语言条件任务)、LIBERO(130 个语言条件任务)、ManiSkill(GPU 并行化)。
评测基准:从成功率到多维度。 RoboDojo 由香港大学多媒体实验室联合 UC Berkeley、清华大学等近 20 所机构发起,设 42 项仿真任务 + 18 项真机任务,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五维度;2026 年 7 月首批榜单中仿真头部模型平均成功率 8.80%、真机最高 12.8%,人类专家分别为 76.03% 与 100%。腾讯联合行业伙伴建立 RxBrain-Bench 用于评测世界认知与目标图像生成。此外,三维几何侧有 DTU/CO3Dv2 等经典基准,空间推理侧有 SpinBench(ICLR 2026)。
真实到仿真再到真实(real2sim2real)。 NVIDIA 提出以手机拍摄 + 三维扫描流水线提取可交互物体,再在仿真中用"数字表亲(digital cousins)"无限增广,形成从真实场景到可训练环境的闭环。
关键突破
- •Ego 视频具备了自动结构化能力:三维手部重建 + 原子动作切分 + 语言生成,使无标注人类视频可批量转化为训练数据。
- •"任务进度"成为可学习的连续信号:EgoTSR 等工作让模型能回答"做到哪一步",直接对应长程任务短板。
- •触觉进入第一人称数据体系,VTLA 概念把触觉与视觉纳入统一处理框架。
- •仿真与真实的边界被打通:real2sim2real 使真实采集可直接转化为可交互环境,放大单条数据的价值。
对产业的影响
第一,自动结构化能力提高了"输入质量"的杠杆。三维手部重建与位姿跟踪依赖精确的相机位姿与时间戳,输入的同步与标定噪声会直接决定预标注可用率——这一指标正取代"标注人效"成为核心运营指标。
第二,仿真平台的多样性要求数据具备良好的元数据。同一批真实数据若要在 Isaac、MuJoCo、Genesis 等多个平台复现,必须提供标定参数、时间基准与物体几何信息。元数据完备的数据集适配成本显著更低。
第三,评测基准的多维化改变了数据的价值函数:泛化、记忆、精细操作、长程执行、开放语义五个维度对数据的要求不同,数据集应当按维度标注自身覆盖,而非只报总量。
第四,合规与可追溯进入采购前置条件:第一人称采集天然涉及人脸、车牌与商业空间,脱敏与授权链条必须随数据一同交付。
配图建议
图 1(放置:导语之后)
- •画面描述:两条腿的咬合示意图。左腿"第一人称真实数据":采集设备 → Ego 多模态流 → 自动结构化;右腿"仿真与评测":仿真平台 → 任务环境 → 评测基准。两条腿在两个连接点相交:① 真实数据为仿真提供场景与任务分布(real2sim);② 仿真把数据放大为可交互环境并回喂策略(sim2real)。底部为共同的"策略训练"平台。
- •图注:图 1|第一人称数据与仿真平台的咬合关系:real2sim2real 闭环。
图 2(放置:"技术要点"中 Ego 结构化段落后)
- •画面描述:Ego 视频自动结构化流水线。四步串联:原始第一人称视频 → 三维手部重建(手部关键点/网格)→ 原子动作切分(按运动学规律把连续动作切为原子段)→ 语言指令与轨迹生成 → 与机器人数据格式一致的训练样本。每步配小图标,步骤间用箭头连接,并在"三维手部重建"下方标注"依赖相机位姿与时间戳精度"。
- •图注:图 2|从无结构人类视频到 VLA 训练样本的自动转化链路(依据 VITRA 一类公开方法绘制)。
图 3(放置:"对产业的影响"第三条之后)
- •画面描述:五维雷达图,五个轴分别为泛化、记忆、精细操作、长程执行、开放语义理解。两条多边形叠放:一条为"当前模型平均水平"(各轴较低),一条为"人类专家"(各轴接近外圈)。在"记忆"轴旁加注释气泡,标注榜单中头部与次优的分差。
- •图注:图 3|评测基准的多维化:模型与人类的差距集中在记忆与长程维度(示意,非精确比例)。
来源与时间
- •EgoTSR(ICML 2026):约 4600 万样本、长程逻辑推理 92.4%、细粒度感知 88.2%(原论文自报指标,评测协议待核实)。
- •EgoScale(ICML 2026,NVIDIA);VITRA(微软亚洲研究院公开技术介绍)。
- •Daimon-Infinity(戴盟机器人联合多机构,2026-04,部分开源 1 万小时)。
- •仿真平台与数据集:中国人工智能学会《具身智能(2026 版)》白皮书整理(Isaac / MuJoCo / PyBullet / SAPIEN / Genesis;BEHAVIOR-1K / CALVIN / LIBERO / ManiSkill)。
- •RoboDojo 榜单(2026-07 首批 / 2026-08-25 更新);RxBrain-Bench(腾讯联合行业伙伴,2026);SpinBench(ICLR 2026)。
- •NVIDIA real2sim2real 与 digital cousins 方案(公开演讲,2026)。
标注说明:EgoTSR 等指标为原论文自报,跨工作不可直接比较;仿真平台能力对比为白皮书整理口径;雷达图为示意性表达,不代表任何具体榜单的精确数值。