返回新闻与洞察
Industry Insight

从观测世界到可验证地行动:具身数据采集白皮书

基于 2026 世界机器人大会现场观察与前沿研究,系统阐释高质量具身数据、Ego 采集、空间对齐和数据治理的共同底座。

2026-08-20
拓比科技|News & Insights
首席洞察 · 官方白皮书
2026 具身智能机器人产业生态论坛现场
OFFICIAL WHITE PAPER · 2026 高质量具身数据集、Ego 数据采集与空间智能的下一阶段

本白皮书基于拓比科技在 2026 世界机器人大会及同期行业交流中的观察、用户提供的会议资料,以及截至 2026 年 8 月 20 日的公开研究编写。文章从数据工程而非单一模型路线出发,讨论如何把第一人称操作、多视角几何、动作、接触、质量证据与数据治理组织为可验证的具身数据资产。

摘要

2026 年 8 月,世界机器人大会在北京经济技术开发区举行,主题为“人机共生,产需共融”。大会官方发布信息显示,本届活动将前沿技术交流、应用牵引、生态共建与产业协同置于同一框架,并把具身智能、真实场景与规模化应用作为重要议题。[1] 对拓比科技而言,参加大会和同期行业交流的价值,不只是观察新品、追踪参数或判断热点,更在于重新回答一个基础问题:当机器人需要在开放世界中理解、预测并改变环境时,什么样的数据才配得上成为其学习世界的证据?

本白皮书提出,具身智能的核心竞争正在从“获得更多视频”转向“形成更多可用证据”。高质量具身数据不是孤立的视频、动作或标注文件,而是一组带有时间、空间、动作、接触、任务、质量、权属与版本信息的可验证观测。它既要让模型看见人和物,也要让模型知道相机在哪里、动作何时发生、物体为何改变、记录是否可信,以及数据可否在不同团队、不同本体和不同版本之间被复现、比较与审计。

围绕这一判断,本文提出 “Ego 数据采集—空间对齐—任务建模—质量证据—模型闭环” 的五层数据基础设施路线。它把第一人称视角视为人类操作意图与操作过程的天然入口,把多视角几何、惯性与可选接触信号视为物理约束,把任务语义与失败样本视为可学习的决策边界,把数据卡与血缘信息视为可采购、可复现、可治理的交付单元,并把世界模型、VLA 与策略评测放回同一个闭环中协同优化。

核心判断: 世界模型、VLA、视觉基础模型和控制策略不应被简化为“路线之争”。它们解决的是不同层次的问题:VLA负责把当前观测和目标转化为动作,世界模型负责推演动作可能造成的未来,数据基础设施负责使两者学习到的关联具有时间、空间、任务和质量上的可验证依据。[2] [3]

本文所说的“前瞻”并非承诺某种技术会在短期内自动解决泛化、因果或安全问题。恰恰相反,随着模型能力进入真实场景,数据采集、标定、授权、质量控制和评测协议会从后台工作变成决定系统边界的前台能力。拓比科技希望以可审计、可复现、可采购的具身数据资产为抓手,与机器人整机、模型研发、场景业主、科研机构和服务网络共同建立一个更能经受验证的物理 AI 数据底座。

一、从大会现场到数据命题:具身智能为何在 2026 年进入“证据工程”阶段

世界机器人大会官方信息显示,2026 年活动于 8 月 19 日至 23 日举行,围绕前沿技术、应用场景、产业生态与国际合作展开;相关发布还强调了数据集建设、应用试用、中试验证和全生命周期可追溯等议题。[1] [4] 这些信号共同指向一个变化:机器人产业不再只讨论“能否做出一个动作”,而越来越需要回答“动作能否在不同场景稳定复现、能否解释失败、能否把经验迁移到更多本体与任务”。

图 2:会议现场关于世界模型定义的演示。
图 2|行业交流中的世界模型定义示意:以状态与动作推演下一状态。该照片记录了现场讨论,不代表拓比科技对画面中任何第三方模型、机构或结果的背书。

现场交流反复出现一个朴素而关键的表达:若当前状态为 $s_t$,动作是 $a_t$,那么系统关心的不仅是“此刻应输出什么动作”,还关心 $s_{t+1}=f(s_t,a_t)$ 所代表的状态迁移。这一表达与机器人世界模型研究的核心定义一致:世界模型应描述环境在动作条件下如何演化,并为规划、评估、仿真、数据生成或策略优化服务。[2] 但从工程视角看,公式成立的前提不是模型足够大,而是训练和评测数据能够可靠回答四个问题:状态是什么、动作是什么、两者在何种时间关系下发生、状态变化是否可被空间和物理约束验证。

因此,具身数据的难点并不是把更多相机接入存储系统。视频中同一只手的移动,若缺少时间同步、相机位姿、任务阶段、对象身份、动作边界或成功条件,在模型训练中可能只是一段相关性很强却无法迁移的视觉片段。相反,一条经过同步、标定和质量审计的轨迹,即使时长有限,也能让研究人员检查从观察到行动的每一环:目标是否出现、手—物接触是否发生、视角是否遮挡、末端轨迹是否连续、任务是否成功、失败来自感知还是控制、数据是否允许用于既定训练目的。

这就是本文所谓的证据工程。它不取代算法创新,而是为算法创新建立可验证输入。VLA 数据综述指出,未来进步越来越依赖数据集、基准和数据引擎的协同设计;真实数据、合成数据、视频到数据流程与硬件辅助采集各有优势和边界,单一指标难以覆盖真实性、成本、规模和泛化之间的张力。[3] 对产业而言,下一阶段的竞争不应只问“有多少小时数据”,而应问“每一小时数据能够为哪些模型、哪些任务、哪些评测提供何种等级的证据”。

从“采集量”思维到“证据工程”思维 仅以数量为中心的做法 以可验证性为中心的做法
核心单位 小时数、帧数、视频文件 任务化、版本化、可追溯的轨迹与数据卡
视觉信息 单一视角的可见画面 Ego、外部、腕部等视角及相机几何关系
动作信息 可选或事后推断 与观测同步的姿态、关节、末端或动作标签
质量判断 清晰度、是否录到 同步、标定、覆盖、连续性、成功/失败、异常与授权
交付方式 素材包 数据集、样例、质量报告、数据卡、许可和版本记录
价值结果 可供浏览或粗训练 可用于训练、评测、审计、采购和迭代闭环

二、科学问题的重新表述:VLA、世界模型与空间智能各自解决什么

把 VLA 与世界模型对立起来,是当前讨论中最容易造成误解的地方。VLA 可以表述为策略函数 $\pi$:在给定视觉观测 $o_t$ 和语言目标 $l$ 后,输出动作或动作片段 $a_{t:t+k}$。它的优势在于把视觉理解、语言指令和控制输出置入统一框架,使机器人能够面向更开放的指令和对象集合学习行为。[2] [3] 然而,直接的观测到动作映射在长程任务、遮挡、分叉结果、接触不确定性和分布外场景中会面对误差累积与因果归因难题。

世界模型则试图学习 $p(x_{t+1:t+H}\mid x_t,a_{t:t+H-1},l)$:在当前状态、动作序列与高层目标条件下,对未来状态或未来观测进行预测。[2] 它的意义不在于生成一段“看起来像真的”视频,而在于生成对候选动作敏感、对空间结构自洽、对后续决策有用的未来。若一个模型在不同相机视角下把同一物体预测到互相矛盾的位置,或让夹爪在画面中看似完成动作而不符合实际几何和接触约束,那么该预测即便视觉流畅,也不能直接成为控制的可靠依据。

空间智能处在两者之间的关键位置。它关心对象、手、工具、机器人和环境在同一坐标系中的几何关系及其随时间变化的规律。对具身数据采集而言,空间智能并不等于“额外增加一个深度图文件”。它意味着:采集系统需要对相机内参、外参、IMU、SLAM 位姿、手部或末端轨迹、对象状态与坐标变换链条进行统一描述,并持续记录其标定版本和有效区间。只有这样,模型的视觉表征才有机会与可执行的运动、接触和工作空间建立稳定联系。

图 3:会议现场关于嵌入 3D 几何先验的视频世界模型演示。
图 3|现场资料中展示的多视角与 3D 几何先验思路。多视角预测的工程价值在于让同一物体、相机和动作具有一致的三维解释。

2026 年的研究进一步强化了这一判断。PAIWorld 的论文指出,多相机机器人操作需要在 Ego、外部和腕部等视角之间保持物体位置、深度与纹理的一致;仅把多个视角的 token 简单拼接,难以显式建立跨视角几何通信与三维约束。[5] Ctrl-World 则显示,可控的多视角世界模型需要面对长时程一致性、帧级动作条件与新相机位置下的预测问题,其特定研究设置中还探索了用想象轨迹来排序和改进策略。[6] 这些结果并不意味着产业可以跳过真实采集,反而说明高质量真实采集需要把相机关系、动作条件和质量边界交给模型学习。

拓比科技的研发立场: 第一人称数据不是替代机器人数据的“便宜视频”,多视角数据也不是叠加更多摄像头的“素材集合”。二者应通过统一时间基准、空间标定和任务语义形成可转换、可检查、可版本化的证据链,进而服务于世界模型的预测、VLA 的行动和系统级的评测。

三、Ego 数据为何成为通往可迁移技能的关键入口

人类完成拧开瓶盖、整理台面、装配零件、端放容器或使用工具时,第一人称视角天然包含了任务相关的注意区域、手—物相对关系、遮挡模式、操作节奏和意图推进。它并不自动等同于机器人视角,却与许多机器人操作系统中的头部、腕部或近端视角共享重要结构:目标物通常处于可操作区域,手或末端执行器围绕目标发生连续交互,动作结果会在局部视野中即时呈现。Ego 数据的价值,正在于把“任务是如何被人看见和推进的”记录为时间连续的过程,而不是只保存任务开始与结束的静态图像。

EgoDex 在 ICLR 2026 发布的研究提供了一个明确案例:该数据集以第一人称视频联合三维手和手指追踪记录人类灵巧操作,覆盖 829 小时、194 类桌面任务。[7] 其重要启示不是规模数字本身,而是视觉、手部运动与空间跟踪在记录时配对。对于希望从人类演示学习操作结构的算法而言,单纯视频容易把“看见手在动”与“知道手在三维空间如何动”混为一谈;配对后的时空记录则为模仿、逆动力学、动作表征学习以及跨本体映射提供更清晰的基础。

但第一人称视角也有天生局限。它可能遮挡关键接触面,对工具末端、全局布局和外部安全边界的可见性不足;人类手与机器人末端之间也存在形态、自由度和动力学差异。因此,拓比科技主张将 Ego 作为高价值主视角,而非唯一视角。对于高价值任务,应把 Ego、外部观察、腕部或末端近景、IMU/SLAM 位姿,以及可选的触觉、力觉、本体状态统一到同一条轨迹中。这样的设计保留了“操作意图从何处发起”的局部优势,又获得了“动作在三维环境中是否真实发生”的外部证据。

数据层级 建议记录内容 主要解决的问题 适用任务
Ego 主视角 第一人称 RGB/视频、头部或设备位姿、IMU 意图、注意、手—物局部交互、自然操作节奏 人类演示、流程学习、操作分段
外部空间视角 固定或移动第三视角、相机标定、深度/点云(可选) 全局布局、遮挡补偿、空间几何、评测可见性 装配、放置、双手协同、长程任务
末端近景 腕部/工具相机、末端位姿 接触前后局部几何、微操作与工具状态 插接、抓取、拧紧、细粒度放置
本体与控制 关节、末端、夹爪、速度、命令、控制频率 视频到动作、动作对齐、跨本体转换 机器人遥操作、策略训练与评测
接触与物理 力、扭矩、触觉、压力、对象状态(按需) 接触事件、摩擦、形变、稳定性 软物体、装配、关节对象、快速放置
任务与质量 指令、步骤、成功/失败、异常、覆盖标签、授权 监督、检索、评估、合规与采购 所有可交付数据资产

DROID 的真实世界操作数据集同样说明,规模化采集并不只是在更多地点部署设备。它采用同步外部与腕部相机、相机标定、动作的多种表示、采集者与任务元数据、成功/失败标记,并在分布式采集场景中以统一硬件与流程提升可复现性。[8] 对拓比科技的启示是,Ego 数据采集设备需要同时承担“观察窗口”和“数据证据采集节点”两种角色:设备端应尽可能稳定地生成同步、连续、可校准的原始流;平台端则应让每一条流能够回溯到设备、时间、任务、版本和质量结果。

四、从相机到空间:多视角与时空同步是数据可用性的第一道门槛

具身数据中最隐蔽也最昂贵的错误,常常不是“画面模糊”,而是时间与空间关系悄然失真。例如,视觉帧比 IMU 落后几十毫秒,手部轨迹与物体接触时刻错开,或相机外参在设备碰撞、佩戴松动后仍沿用旧值。对于人类观看而言,这些偏差可能不明显;对于需要学习动作条件状态迁移的模型而言,它们却会把真正的因果关系冲淡为噪声相关性。

因此,高质量采集的第一原则应是先定义时间,再积累画面。拓比科技建议以统一时钟、明确的时间戳语义和可验证的同步误差范围组织所有传感器流。对每次采集,应记录时钟来源、传感器频率、丢帧/重传策略、同步方式、偏移检测结果与适用有效区间。质量报告不应只写“已同步”,而应将可接受的时间误差作为任务规格的一部分:高速抓取、快速放置和接触瞬间需要更严格的边界,低动态流程观察则可采用更经济的配置。

第二原则是先定义坐标链,再谈三维理解。每个数据包至少应能清楚回答:相机相对于佩戴者、工具、机器人基座和场景坐标系的位置关系是什么;使用了哪一版内外参;SLAM、标定板、视觉重建或其他方法在何种质量阈值下有效;坐标变换由哪些可追溯步骤生成。三维并不是一张深度图,而是一个可检查的变换系统。若这一系统不能复现,模型在训练阶段看似拥有“多视角”,部署时却无法把感知转为稳定动作。

第三原则是把空间异常显式标为数据的一部分。反光、透明物、快速运动、严重遮挡、重定位、标定失败、佩戴设备位移、地图漂移和强光变化,都不应在后处理时被静默抹去。它们既是质量风险,也是模型鲁棒性所需要的难例。合理做法不是把异常全部混入“正常数据”,而是提供可筛选的质量等级、异常类型和处置记录,使研究团队能够按任务需求选择严格子集、鲁棒子集或专门的挑战集。

五、世界模型对数据提出的新要求:不是“未来画面”,而是“可控未来”

传统视频预测更关注画面连续、人物和物体形态自然;机器人世界模型则必须更进一步:预测的未来应与候选动作、视角几何、对象约束和接触事件相容。世界模型综述将这一方向概括为面向策略的预测结构,其价值包括前瞻、想象驱动的规划以及数据扩增;关键不是视觉上合理,而是对动作的后果具有可操作意义。[2]

图 4:会议现场关于隐空间扩散世界模型的主题分享。
图 4|现场资料讨论“隐空间扩散模型”与世界模型。对于产业采集系统而言,模型结构持续演进,但时间、空间、动作和质量证据是更稳定的数据底层要求。

这意味着采集系统应从一开始就服务于反事实与控制问题。对于同一个起始状态,数据中若只记录一种成功动作,模型难以区分“哪些动作会造成不同结果”。因此,高质量数据引擎应在安全和任务允许的范围内记录合理的动作变体、不同初始条件、接近成功的失败、重试过程和恢复行为。失败数据不是应当丢弃的废料;在明确失败原因、确保安全与隐私边界的前提下,它是界定策略边界、训练风险识别和改进世界模型的重要证据。

Ctrl-World 的研究把多视角、帧级动作条件和长时程一致性放到同一模型中,并在特定评测设定下探索用想象空间辅助策略排序与监督微调。[6] 这一方向提醒产业界:未来的数据集不只要提供“发生过什么”,也要通过高质量状态、动作与结果对齐,让模型有机会学习“如果这样做,可能发生什么”。不过,想象轨迹不能取代真实世界验证。它更适合作为降低筛选成本、生成假设和辅助训练的工具;最终是否可部署,仍要回到真实场景、真实硬件、真实安全约束下的闭环测试。

对于拓比科技而言,世界模型时代的数据策略应包含三类协同资产。第一类是真实基座数据,用于保留相机噪声、接触摩擦、环境干扰和人类操作差异等不可轻易模拟的物理事实;第二类是结构化任务数据,用于提供状态、动作、目标、阶段、成功条件和异常边界;第三类是可验证的派生数据,例如重建、标注、分段、对齐、合成增强和质量标签。三者之间必须由血缘关系连接,避免派生数据脱离原始证据后难以追责或复现。

六、超越“视频+文本”:接触、力觉与对象状态如何进入高价值数据集

机器人真正困难的任务往往不是看见物体,而是处理看不见的物理量:瓶盖拧到何种阻尼、插头是否已经接触、软物体是否被挤压、抽屉是否受阻、杯子是否即将滑落。仅依赖视觉的策略可以完成部分开放世界任务,但在接触丰富、形变明显或安全敏感的场景中,视觉常常受到遮挡、材质和视角限制。此时,力、扭矩、触觉、压力、本体状态及对象状态不是锦上添花,而是对“发生了什么”的补充证据。

CVPR 2026 的 Hoi! 数据集将跨视角视频与力、触觉和关节对象操作联合记录,覆盖人手、腕部相机与多种工具本体,展示了“看见、做到、感觉到”可以在同一数据结构中被组织。[9] 另一项面向人形接触操作的数据研究显示,在软物体和不同压力条件下,密集触觉信号能够表达随时间变化的接触模式,但也会带来更高维度、更复杂的优化和质量控制挑战。[10] 这说明多模态并非“信号越多越好”,而是必须围绕任务所需的可观测物理量进行配置。

拓比科技建议把多模态策略划分为三个层级。基础层以视觉、时间、空间和动作为必选项,支撑绝大多数感知—行动学习;增强层针对工具使用、精细抓取、装配和移动操作加入腕部视角、深度、末端状态或对象状态;高价值层面向插接、拧紧、软物体、快速放置、危险接触等任务加入力/扭矩/触觉/压力,并制定独立的传感器标定与质量规则。这样的分层既避免把昂贵传感器无差别铺到所有任务上,也避免在最需要物理证据的任务中只交付表面视频。

在数据结构上,应将“接触事件”从事后标签提升为可查询实体。一次抓取可包含接近、预接触、初始接触、稳定抓持、移动、释放和结果确认等阶段;每个阶段应尽可能关联对应的视觉片段、时空状态、动作片段、接触信号、对象状态和质量结论。这样,研究人员既能训练端到端模型,也能针对失败环节构建诊断模型,例如区分感知失败、路径失败、力控失败、对象状态估计失败或任务语义理解失败。

七、定义“高质量”:从单一清晰度检查走向六维质量证据

高质量不是一个形容词,而是一套可以被执行、被抽检、被复核的质量定义。行业中常见的误区是把高分辨率、长时长或大规模等同于高质量;这些属性当然重要,却不能证明数据适用于特定任务。一个 4K 视频如果没有可信时间戳、无法确认相机位姿、任务成功条件模糊或授权范围不明,仍然难以成为机器人策略训练的可靠资产。相反,一段分辨率适中但动作、空间、任务和质量边界明确的轨迹,可能更适合作为模型评测、失败诊断和可复现训练的基础。

拓比科技提出以 “六维质量证据模型” 定义具身数据的交付质量。第一维是感知完整性,检查图像、深度、IMU、音频或其他必需流的缺失、曝光、运动模糊、遮挡与可见性。第二维是时空一致性,检查统一时钟、跨流同步、相机内外参、位姿连续性、坐标变换和重定位异常。第三维是动作可用性,检查动作表示、控制频率、末端/关节状态、动作连续性、命令与执行差异及动作边界。第四维是任务语义正确性,检查语言指令、对象、工具、步骤、成功/失败、异常和目标状态是否与原始证据相符。第五维是物理有效性,检查接触、力觉、对象状态和安全边界是否达到任务所需的可观测程度。第六维是治理可追溯性,检查来源、授权、隐私处理、版本、处理流程、质检记录和用途限制。

六维质量证据 关键问题 典型测量或抽检方法 交付物
感知完整性 模型是否看到了完成任务所需的内容? 丢帧率、曝光/模糊检测、关键对象可见率、遮挡抽检 流完整性报告、异常片段索引
时空一致性 不同传感器是否记录了同一个事件? 时间偏移、漂移、重投影误差、位姿连续性、标定有效期 同步报告、标定文件、坐标系说明
动作可用性 观测能否与可执行动作关联? 频率、连续性、关节/末端转换、命令—执行误差 动作字典、控制接口说明
任务语义正确性 任务、步骤与结果是否能被复核? 双人抽检、规则一致性、对象/指令对齐、失败原因标签 任务本体、标注规范、抽检记录
物理有效性 对接触、形变和约束的记录是否足够? 力/触觉标定、事件对齐、对象状态、接触覆盖 模态说明、物理事件表、传感器报告
治理可追溯性 数据能否被安全、合法、可复现地使用? 来源链、许可核验、脱敏记录、哈希、版本对比 数据卡、许可、血缘图、版本日志

该模型强调一个原则:质量是相对于预期用途的。 用于大规模视觉预训练的数据可优先关注场景、对象和动作多样性;用于三维世界模型的数据必须提升标定、跨视角对应和空间一致性要求;用于高风险接触任务的数据则需要更严格的动作、力觉与失败记录。把所有数据按同一“满分标准”处理会造成浪费,把不同用途的数据按同一“最低标准”交付又会造成不可控风险。正确做法是将用途、任务、模态与质量阈值写入 SOW、采集方案和数据卡,使验收从主观观感转为可复核证据。

八、数据卡与数据血缘:让具身数据成为可采购、可复现的工程资产

高质量数据不应只有文件目录,还应有能被人和机器理解的“身份证”。机器人数据血缘研究提出,来源、配置、执行和后处理之间的关系应当在数据产生过程中被记录;仅在发布时补充说明,往往无法恢复真实的输入、版本和处理路径。[11] 这与具身数据的特点高度吻合:传感器多、数据流快、软硬件版本迭代频繁、场景与人员分布广,任何一处缺少记录都可能让后续训练或评估失去可解释性。

因此,拓比科技建议以轨迹级—批次级—数据集级三层数据卡组织交付。轨迹级数据卡记录本次操作的任务、时间、设备、传感器、坐标系、质量结论、成功/失败、异常和授权状态;批次级数据卡描述相同采集规范下的一组轨迹,包括场景、对象、操作者/采集角色的匿名化信息、版本、抽检比例和质量分布;数据集级数据卡则说明整体目的、覆盖范围、模态、数据格式、许可、已知局限、推荐用途、不推荐用途、版本变化和获取方式。

数据卡字段组 建议字段 解决的工程问题
身份与版本 数据集 ID、轨迹 ID、哈希、创建时间、版本、父版本 防止文件混淆,支持增量更新与回退
采集环境 场景类型、对象类别、光照、工作空间、风险等级 支持场景分层、域偏移分析与任务检索
设备与标定 设备型号、传感器配置、固件、内外参、坐标系、标定时间 支持空间复现与多设备比较
时间与同步 时钟来源、频率、时间戳、偏移、丢帧、有效区间 支持跨模态对齐与事件分析
任务与动作 自然语言目标、步骤、对象、工具、动作表示、成功条件 支持 VLA 监督、过程检索和任务评测
质量与异常 自动检查、人工抽检、质量等级、失败类型、异常片段 支持按用途筛选、训练过滤与错误诊断
权属与治理 采集授权、许可、脱敏、访问级别、用途限制、保留策略 支持合规采购、跨组织协作与责任界定

这种数据卡不是行政附件,而是模型工程的接口。它帮助算法团队在训练前确定哪些轨迹应进入基础预训练、哪些应进入空间一致性学习、哪些应进入接触技能微调、哪些只能用于内部评测;也帮助业务团队明确数据是否满足可交付范围、是否可复用、是否需要补采。对采购方而言,数据卡提供了技术尽调的起点:不是问“你们有多少数据”,而是问“这批数据的时空基准、任务覆盖、质量阈值、授权边界和已知局限是什么”。

可复现性研究进一步指出,具身系统中的传感器、执行器、环境条件、材料、软件和测量精度都可能改变实验结论,因此需要透明报告、变量控制与端到端的实验记录。[12] 这意味着数据卡还应包含“不能做什么”的说明。例如,某批人类 Ego 视频可能适合学习任务分段与语义先验,但未必适合直接生成机器人关节动作;某批多视角数据可能具有丰富视觉信息,却因标定漂移而不适合三维监督;某批接触数据可能只覆盖硬物体,不能用于推断软物体的压力控制。把边界写清楚,是对客户、研究人员和行业最有价值的诚实。

九、拓比科技的建议性研发路线:以 Ego 数据为入口,构建物理 AI 的闭环数据引擎

基于大会观察、会议资料和公开研究,拓比科技提出一条面向具身数据的建议性研发路线:不是先确定某一种“终极模型”,再被动搜集数据;而是围绕可验证任务建立数据—模型—评测—再采集的闭环。 这一方向既适用于内部研发,也适用于与客户、服务商、整机企业和科研机构共同建设的数据项目。

第一阶段是任务定义与场景建模。在采集前,应将“帮机器人学会做事”拆成可验收任务:目标是什么、对象与工具是什么、环境约束是什么、完成后可观察到的状态变化是什么、允许的失败是什么、需要何种动作精度和物理感知。对于同一个“放置”任务,轻放、快速放置、窄口插入、软物放置和液体容器放置所需的数据完全不同。任务定义应同时形成采集脚本、质量阈值、标注本体和最终评测协议,而不是把这些工作推迟到采集完成之后。

第二阶段是Ego 优先的多模态采集。第一人称设备负责记录自然操作与局部交互,外部和腕部视角负责补足全局空间与接触前后的细节,IMU/SLAM/标定系统负责建立可追溯空间基准。面对复杂任务,应把数据采集划分为可扩展的模态包:基础包服务大规模场景与动作理解,空间包服务几何和多视角世界模型,接触包服务力控与精细操作。这样既能控制成本,也能使每一类数据有明确用途。

第三阶段是在线质量门控与边缘预处理。许多严重质量问题在采集现场就应被发现,而非数周后才在训练中暴露。设备和平台可以对时间戳异常、丢帧、图像不可用、标定失效、设备移位、视觉遮挡、动作范围越界和任务脚本偏离发出提示。在线门控不是为了让采集员机械追求“零异常”,而是为了把异常变成可见、可处理、可标记的事件。对高价值轨迹,可触发即时复采或人工复核;对有研究价值的难例,可带着明确标签进入鲁棒性数据池。

第四阶段是数据生产与版本化交付。原始数据、对齐数据、标注数据、派生特征、训练子集和评测子集不应混在同一目录。应通过版本、哈希和血缘关系保持它们的可追溯性,并将数据处理定义为可复跑的流水线。真正高效的数据工程,不是只追求一次性项目交付,而是让后续新增场景、修订标定、改进标签和模型反馈能够在不破坏历史版本的前提下持续进入资产库。

第五阶段是模型驱动的主动再采集。模型训练与评测应反向告诉数据引擎哪里缺数据:某类对象、光照、姿态、接触条件、语言表达、视角组合或失败恢复是否造成系统性薄弱?如果世界模型在跨视角一致性上失败,优先补的是哪些标定良好的多视角轨迹?如果 VLA 在长程任务中失败,优先补的是哪些任务分段、过渡状态和恢复动作?数据规模化的本质不是无限堆积,而是用评测证据指导增量采集,使每一轮新增数据都能缩小已知能力边界。

图 5:会议现场对具身智能、物理智能与世界模型关系的总结。
图 5|现场讨论强调以状态转移理解世界模型。拓比科技据此提出:数据工程应让状态、动作和结果之间的关系可被同步、标定、验证和回溯。
闭环环节 TOBI 建议的关键产物 应回答的核心问题
任务定义 SOW、任务树、风险清单、验收阈值 机器人最终要学会什么,如何判定成功?
采集设计 模态包、设备配置、坐标系、时间基准、脚本 应记录哪些可观测量,精度边界是什么?
现场执行 原始流、在线告警、异常标记、复采记录 当前轨迹是否可用,异常是否被正确处置?
数据生产 对齐、标注、质检、数据卡、版本与许可 数据能否被准确检索、训练和审计?
模型评测 覆盖矩阵、失败簇、对照集、回归报告 系统在哪里有效、在哪里失败、为什么失败?
主动再采集 缺口清单、难例任务、增量版本 下一批数据如何最大化降低不确定性?

十、从相关性到因果可用性:何为“行动可验证的数据”

会议资料提出,单纯从图像到动作的学习容易受到数据不足和关联性边界的制约。应当谨慎理解这一观点:VLA 并非无效,世界模型也并非自动带来因果理解。更准确的说法是,具身系统的因果可用性必须由模型、数据和实验共同建立。 模型可以提出对未来的预测,数据可以提供动作与结果的对齐证据,实验和评测则负责检验预测是否在改变条件后仍然成立。

行动可验证的数据至少应提供三层对照。第一层是时间对照:动作前、中、后是否有足够连续的观测,以判断变化发生在何时。第二层是空间对照:对象、手、工具、机器人与环境之间是否存在可复核的相对位置和几何关系。第三层是任务对照:同一目标在不同初始条件、对象属性、环境光照、视角或操作方式下是否有可比较样本。只有具备这些对照,研究人员才更有可能区分“模型记住了某个画面”与“模型学到了可迁移的任务结构”。

对产业数据项目而言,因果可用性不要求每条轨迹都设计成严格的科学实验;那样成本会不可承受。它要求的是在数据组合层面建立有意识的覆盖。例如,对抓取任务,可在对象材质、大小、摆放、光照、遮挡和接近方式上设计可控变体;对工具使用任务,可记录正常步骤、常见误用、接触失败和恢复;对装配任务,可在装配公差、插入角度和力控边界上形成清晰的难度梯度。这样,模型不必从无结构的海量素材中猜测什么最重要,数据本身已经为泛化和诊断提供了组织结构。

世界模型和 VLA 的结合可以在这一基础上更有意义。VLA 提供“在当前观测与目标下如何行动”的能力;世界模型提供“若如此行动,可能看到和遭遇什么”的预测;评测器检查预测和真实结果的偏差;数据引擎再针对偏差采集新证据。NVIDIA 对 World-Action Model 的产业观察也认为,未来可能不是纯 VLA 或纯世界模型的单一胜出,而是视觉语言理解、未来预测与动作生成在混合系统中共同优化。[13] 这仍是一项快速演进中的技术判断,而不是已被完全解决的产业事实,但它足以说明数据采集应当同时面向观察、预测与行动,而不能只服务某一种暂时流行的模型接口。

十一、规模化之前先标准化:覆盖、难度、失败与评测的共同语言

规模化数据最常见的风险,是在缺乏共同语言时快速累积异构噪声。不同采集员对同一任务命名不同,不同团队使用不同坐标系,不同设备以不同频率记录动作,不同项目以不同标准标注“成功”,最终导致数据在文件层面可以汇总,在模型层面却难以比较。DROID 的分布式采集经验表明,统一硬件/控制栈、明确相机标定、任务元数据和采集协议,是在多地点收集真实操作数据的关键工程条件。[8]

拓比科技建议将标准化分为四个层次。任务标准化定义目标、对象、步骤、成功条件和失败类型;动作标准化定义末端、关节、夹爪、手部或工具动作的表示和坐标系;观测标准化定义各传感器的时间、空间、格式和质量规则;治理标准化定义数据卡、许可、脱敏、访问、版本和责任边界。标准化不应压缩所有场景的独特性,而应让独特性拥有可被记录和比较的位置。

覆盖率也应从简单的类别计数升级为任务—环境—对象—视角—动作—物理条件的联合矩阵。一批数据若拥有 100 个“任务名称”,但都在同一张桌子、同一类物体、同一角度、同一光照下完成,模型的外推边界依然有限。反过来,拥有较少任务名称但在多场景、多对象、不同相机关系和不同难度梯度下有系统覆盖的数据,可能更适合研究鲁棒性。数据团队应定期输出覆盖热图和缺口清单,而不只是总量仪表盘。

失败同样需要标准化。应至少区分感知失败、定位/标定失败、路径失败、抓取失败、接触/力控失败、对象状态失败、语言/任务理解失败、安全中断、设备故障与未知原因。失败标签不是为了给采集员施加不必要的压力,而是为了将“没有成功”转换为模型、数据和工程都能学习的结构化信息。对于高质量数据集,失败轨迹应有明确用途:作为鲁棒性训练样本、作为策略拒绝/恢复学习样本、作为风险评估样本,或作为质量异常被排除并保留处置理由。

十二、数据治理与负责任发布:物理世界的数据更需要边界

具身智能数据直接来自人、场所、工具、生产流程和真实物理环境,其治理不能沿用“互联网素材默认可用”的思维。NeurIPS 2025 的一篇立场论文提醒,具身 AI 同时涉及物理伤害、信息与隐私、经济和社会风险,既有的工业机器人或自动驾驶治理框架未必覆盖全部问题。[14] 对数据采集而言,这意味着授权、脱敏、用途边界、访问控制、保留策略、事件响应和责任划分必须在项目开始时就被设计进去。

首先,应把采集场景划分为公开、受限和敏感等级。公开场景也要说明拍摄范围和用途;受限场景需要约定人员、设备、工艺信息和第三方标识的处理方式;敏感场景应在必要时采用最小化采集、边缘脱敏、分级访问、加密存储和严格的审计日志。对于人类操作数据,应明确参与者知情、可撤回机制、身份信息处理方式,以及数据能否被用于模型训练、展示、对外共享或衍生产品。

其次,应把许可写成机器和业务都可理解的规则,而不是附在合同中的模糊文字。许可至少应说明数据所有权/使用权、训练用途、是否允许再分发、是否允许合成派生、地域与期限、是否允许商业化、是否需要删除或更新、以及违反用途边界后的处置方式。对于客户定制数据,更应让数据卡与合同、SOW、交付清单相互对应,避免“技术上可复制”与“商业上可使用”之间出现空白。

最后,治理不是阻碍数据规模化,而是规模化的前提。可追溯的来源、清晰的许可、可复跑的处理链和可审计的版本,会降低跨机构协作中的信任成本。机器人产业进入真实场景后,数据质量和数据权利将越来越像硬件可靠性一样成为基础能力:只有清楚知道数据从哪里来、经过什么处理、能用于什么、不能用于什么,才能把数据变成长期可积累的资产,而不是短期可消耗的素材。

十三、面向 2026—2028 的行动框架:从单点采集项目走向数据基础设施

拓比科技认为,未来两到三年内,具身数据建设将经历三个并行演化。第一,从记录行为走向记录状态迁移。采集系统会更重视动作条件、对象状态、空间几何和结果验证,使数据更适合世界模型与闭环控制。第二,从单一视觉走向分层多模态。Ego、外部、腕部、深度、位姿、本体和可选触觉/力觉会按任务价值组合,而非无差别堆叠。第三,从项目交付走向可运营的数据资产。数据卡、版本、许可、质量报告、样例和反馈闭环将成为客户采购和长期合作的标准组成。

为了把趋势转化为可执行的项目,本文给出四项建议。其一,先建立高价值任务库,而不是先追求全行业任务列表;选取能代表客户核心业务、具备可观察成功条件且有持续增量空间的任务。其二,为每个任务配置适配的模态与质量门槛;不要以单一设备配置承担所有任务,也不要以低价值数据拖累高价值任务的质量。其三,在首批数据交付前就运行小规模端到端验证,包括数据读取、对齐、训练、评测、失败回溯和权限检查;只有整个链条跑通,规模化才有意义。其四,建立数据—模型联合评审机制,让采集、算法、产品、场景和合规人员共同决定下一轮数据缺口,而不是各自优化局部指标。

时间窗口 建议重点 关键产出 成功标志
0—3 个月 选定高价值任务,冻结基础规范 任务树、SOW、模态方案、质量指标、数据卡模板 小批样本可被算法和业务共同验收
3—6 个月 建立稳定采集与数据生产流水线 同步/标定流程、质检规则、版本系统、样例集 关键质量指标稳定,异常可回溯
6—12 个月 建立评测与主动再采集闭环 覆盖矩阵、失败簇、回归集、缺口清单 新增数据能解释并改善已知薄弱点
12 个月以上 扩展场景与合作网络,沉淀可采购资产 数据产品目录、许可策略、服务商规范、跨项目资产层 数据能安全复用、按规格采购并持续迭代

结语:把物理世界的复杂性,转化为可验证的学习基础

在 2026 年的具身智能讨论中,世界模型、VLA、空间智能、视频生成、遥操作、触觉和人形机器人都在快速发展。真正决定这些技术能否在真实世界形成稳定能力的,并不是某一个概念的热度,而是是否拥有足以支撑观察、预测、行动和验证的数据基础。高质量具身数据集不是“更多拍摄”,而是“更好地定义、记录、对齐、证明和迭代”。

拓比科技希望推动的,不是一套封闭的模型叙事,而是一种开放的数据工程方法:以 Ego 数据记录自然操作,以多视角和空间标定建立几何证据,以动作与可选接触信号连接物理过程,以任务和失败标签呈现决策边界,以数据卡、许可和版本完成可审计交付,以模型评测反馈指导下一轮采集。只有当数据能够被验证、被复现、被正确使用,具身智能才有机会从演示走向可靠的生产力。

拓比科技的前瞻承诺: 面向具身智能的数据项目,应让每一条高价值轨迹都尽可能回答五个问题——它记录了什么任务?它在什么时空条件下发生?它与什么动作和结果相连?它的质量证据是什么?它能在何种授权范围内被谁使用?这五个问题,是可审计、可复现、可采购的具身数据资产的起点。


现场资料说明

本文配图来自用户提供的 2026 年 8 月 20 日具身智能与世界模型主题交流现场资料。图片用于呈现行业交流环境与演示主题,不构成对画面中任何机构、人员、模型、赛事、产品或观点的合作、归属、商业背书或性能声明。文中对研究进展的事实性描述以公开来源为准;对拓比科技的内容主要是面向具身数据采集和数据工程的建议性研发方法论。

参考文献与来源

  1. 世界机器人大会:‘人机共生,产需共融’ 2026世界机器人大会新闻发布会在京召开
  2. Hou et al. (2026), World Model for Robot Learning: A Comprehensive Survey
  3. Wang et al. (2026), Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines
  4. 北京市科学技术委员会:2026世界机器人大会8月在京启幕
  5. PAIWorld Team (2026), A 3D-Consistent World Foundation Model for Robotic Manipulation
  6. Guo et al. (2026), Ctrl-World: A Controllable Generative World Model for Robot Manipulation
  7. Hoque et al. (2026), EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video
  8. Khazatsky et al. (2025 version), DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
  9. Engelbracht et al. (2026), Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation
  10. Kwon et al. (2025), A Humanoid Visual-Tactile-Action Dataset for Contact-Rich Manipulation
  11. Ortega et al. (2026), Replicable Simulation-Based Robot Validation through Provenance
  12. Howard (2026), Operationalising reproducibility in soft robotics
  13. NVIDIA Technical Blog (2026), Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models
  14. Perlo et al. (2025), Emerging Risks from Embodied AI Require Urgent Policy Action

为具身智能项目定制数据采集方案?

TOBI 可提供面向具身智能训练与评测的多模态、长时序、真实场景数据采集服务,支持任务设计、设备部署、时间与空间对齐、质量审计和数据卡交付。