返回新闻与洞察
视觉算法专项

3D 场景理解:从"识别物体"到"理解可行动的空间"

具身智能对三维场景理解的要求,与计算机视觉的传统目标并不一致。传统任务关心"这是什么、在哪里",而机器人关心"我能否过去、能否抓住、抓哪里不会滑"。这一差别使 3D 场景理解在 2025—2026 年发生了表征层面…

2026-09-08
拓比科技视觉算法团队
视觉算法专项
TOBI E6 六目具身智能采集设备佩戴实景

摘要

具身智能对三维场景理解的要求,与计算机视觉的传统目标并不一致。传统任务关心"这是什么、在哪里",而机器人关心"我能否过去、能否抓住、抓哪里不会滑"。这一差别使 3D 场景理解在 2025—2026 年发生了表征层面的重构:从以物体检测与实例分割为中心,转向以占据、符号距离与可行动性为中心的连续场表征;从依赖离线重建的静态地图,转向可在前馈推理中实时获得的空间先验。本文梳理这一转变的技术路径、代表工作与工程边界,并给出对数据采集与交付的落地建议。

配图方案

配图位置 1(摘要之后)|图像内容:同一场景的三种表征并列——(a) 二维检测框与实例分割、(b) 体素/占据栅格、(c) 连续距离场与可通行区域叠加。图注要求:图 1|3D 场景理解的三种表征:离散实例、离散占据、连续场;机器人决策真正需要的是第三类。

一、问题背景:为什么二维语义不够用

二维视觉在过去十年取得了统治性成功,但其成功建立在"识别"这一任务定义上。对操作任务而言,识别只是起点:夹爪需要从哪个方向接近、抓取点的法向朝哪里、物体之间是否存在可供穿行的间隙、桌面边缘距离当前位姿多少毫米——这些信息都不存在于类别标签之中。

早期机器人系统的做法是拼接:用检测框给出物体位置,用深度相机给出距离,用 SLAM 给出自身位姿,再用手眼标定把三者统一到同一坐标系。这套方案在结构化环境中可用,但存在三个结构性缺陷:其一,误差在模块间级联且无法自校正;其二,各模块的输出粒度不一致(稀疏框 vs 稠密深度 vs 六自由度位姿),融合时信息损失严重;其三,整套流水线不可微,无法与策略联合优化。

配图方案

配图位置 2(本节末尾)|图像内容:模块化流水线的误差级联示意图——检测框偏移 → 抓取点偏移 → 姿态估计错误 → 抓取失败,每一级用箭头连接并标注误差放大系数。图注要求:图 2|模块化感知流水线的误差级联:每一级误差都会被下游放大,且无法反向校正。

二、核心技术路径

2.1 占据与符号距离场:连续化取代离散化

占据栅格(occupancy grid)把空间离散为体素并判断每个体素是否被占据,其优势是便于碰撞检测与路径规划,劣势是分辨率与显存的平方—立方权衡。符号距离场(SDF)与截断符号距离场(TSDF)用连续函数描述"到最近表面的有符号距离",在任意分辨率下可查询,更适合精细操作。近年工作倾向于用神经网络隐式表达场(如基于坐标的 MLP 或哈希编码),使场可从图像前馈预测,从而摆脱逐场景优化。

2.2 前馈三维重建:从优化到一次推理

VGGT(CVPR 2025 最佳论文)确立了前馈式三维重建范式:把整个图像集合一次性输入 Transformer,一次前向直接输出相机内外参、稠密深度、点图与三维点轨迹。其核心是交替注意力——帧内局部注意力保留空间细节,跨帧全局注意力聚合同一场景的几何证据——使全局一致性由网络结构保证,而非依靠事后优化。相比 DUSt3R/MASt3R 需要逐对预测再全局拼接,VGGT 原生支持 1 到数百视角,速度从 SfM 的分钟—小时级压缩到秒级,在 CO3Dv2 上位姿估计 AUC@30 达 88.2%。

Depth Anything 3(ICLR 2026)则从极简方向给出同等结论:一个未经架构特化的普通 DINOv2 骨干 + 统一的"深度—射线"表示,即可覆盖单目深度、多视深度、位姿估计与三维高斯生成,在单目深度上超越 DA2,在多视深度与位姿上超越 VGGT。这两个工作的共同含义是:几何不再是后处理工序,而是一种可预训练、可迁移的表征

2.3 稀疏 token 与占据预测

CVPR 2026 的 Oral 工作 SparseWorld-TC 突破传统鸟瞰图投影的瓶颈,用稀疏 token 端到端预测多帧三维场景占据。这条路径的工程含义是:场景理解不需要稠密重建每一个体素,只需要在决策相关的区域保持高分辨率——这与"注意力应当分配给可行动区域"的直觉一致。

2.4 从静态三维到时序四维:可行动性的显式化

静态三维场景只回答"空间长什么样",而操作还需要回答"下一步会变成什么样"。因此 2025—2026 年的一条清晰线索是把时间维度引入场景表示:从逐帧独立的占据预测,走向带运动线索的时序占据(occupancy flow / 4D 占据)。SparseWorld-TC 的"时序稀疏 token"正是这一思路的代表:它在多帧之间共享与传递稀疏 token,使模型既能保持时序一致性,又不必付出稠密四维表示的计算代价。

与时序化并行发展的,是可行动性(actionability)的显式化。传统占据只区分"有物体/无物体",而操作决策真正需要的是"这个位置能否被抓取、能否被穿过、抓取后是否稳定"。这推动了两类扩展表示:一类是在占据或距离场上叠加语义与物理属性(材质、刚度、摩擦,其中后两者只能靠弱先验估计,可靠性有限);另一类是把可供性(affordance)直接作为场的一部分输出,即预测"在每个空间位置上执行某类动作的成功概率"。后者与本文主题相邻,是可行动性最直接的数学形式,但它的标注成本与任务依赖性也最高——同一个杯子的可供性在"倒水"与"收纳"两种任务下完全不同。

一个务实的工程判断是:对多数工业场景,不需要追求统一的可行动性场。更经济的方法是分层——用占据场支撑碰撞与通行判断(低风险、高可靠),用关键点或作用轴表示抓取与操作位姿(可解释、易复核),只在柔性物体与精密装配等少数场景中引入更重的连续场方法。把复杂表示用在真正需要的地方,比追求统一的优雅表示更能降低系统风险。

配图方案

配图位置 3(本节末尾)|图像内容:前馈重建与稀疏占据的结构对照图。上半:多视角图像 → Transformer(交替注意力框)→ 位姿/深度/点图/轨迹四路输出;下半:同一输入 → 稀疏 token 选择 → 仅在高相关性区域生成占据。图注要求:图 3|稠密前馈重建与稀疏占据预测:前者追求完整性,后者追求决策相关性。

三、代表工作对比

路线代表工作输出优势局限
优化式 SfM/MVSCOLMAP 系稀疏点云 + 位姿度量精度高、理论完备慢、弱纹理失效、不可微
逐对 pointmapDUSt3R / MASt3R逐对点图 + 全局对齐可微、弱纹理更稳累积误差、视角多时难收敛
前馈统一VGGT / VGGT-Ω位姿 + 深度 + 点图 + 轨迹秒级、全局一致、原生多视角Sim(3) 尺度歧义、显存随视角增长
极简统一表示Depth Anything 3深度 + 射线 + 位姿 + 3DGS架构简单、覆盖任务多米制需 Metric 系列或外部对齐
稀疏占据SparseWorld-TC 等多帧三维占据高效、面向决策语义粒度较粗

需要强调的是,这些路线并非替代关系。实际系统通常采用分层策略:以前馈模型获得实时几何先验,以稀疏占据支撑规划与碰撞检测,以优化式方法在需要高精度测量的工位做离线标定与验收。

四、挑战与趋势

挑战一:尺度歧义。 前馈模型从纯 RGB 预测的几何存在相似变换歧义,整体缩放无法确定。机器人必须知道 35.2 厘米与 35.4 厘米的区别,因此必须引入外部锚点:已知尺寸的标定物、固定基线的双目几何、LiDAR 或回环闭合。MoGe-2 的实验直观说明了这一点——不做校准时相对误差从 0.142 劣化到 0.210。结论:绝对精度来自标定与对齐,不来自更大的模型。

挑战二:工况退化。 弱纹理白墙、镜面与金属、玻璃、快速运动模糊,是所有学习式几何方法的系统性失败区,而这些恰恰是工业现场的高频场景。工程对策是多模态冗余:用主动结构光或 ToF 提供稀疏但可靠的深度锚点,用学习模型补全稠密几何。

挑战三:动态场景。 多数几何模型假设场景静态,被操作物体与人手会造成"重影"与尺度漂移。实用做法是把动态物体分割出来单独跟踪,静态背景用于定位。

趋势一:几何 token 成为通用接口。 VGGT 的 register token 已被探索作为可直接查询的三维场景提示,支持"找出位于桌面左侧、距边缘 5 厘米内的物体"这类组合式检索。

趋势二:几何与语义双塔对齐。 单纯替换骨干的收益小于把几何塔与语义塔对齐——北京人形 XR-1 的消融显示,KL 对齐损失可带来近 20 个百分点的成功率提升。

趋势三:统一 3D/4D 世界建模。 把前馈几何扩展到自回归、轨迹一致的高维几何 token 空间,本质上就是具备几何一致性的世界模型,这可能是 VLA 与世界模型之争的收敛点。

趋势四:三维原生骨干取代"二维骨干 + 几何头"。 在过去两年,主流做法是拿一个在二维图像上预训练的骨干,接一个几何预测头。这种做法继承了强大的语义先验,但二维特征与三维几何之间存在表示错配:图像分辨率与空间分辨率耦合、遮挡关系被压平、视角变化导致特征跳变。2026 年出现的三维原生骨干(如 VGA,arXiv 2604.12908,采用位置编码与体素化机制直接在三维空间建模)在 LIBERO 等操作基准上达到 SOTA,提示"直接在三维空间预训练"可能比"在二维预训练后提升到三维"更具上限。这一方向目前仍处于早期,训练数据与算力成本是主要制约。

趋势五:几何能力下沉为数据管线的基础设施。 前馈重建因其速度快、可批处理、可微分,正在被大量用于三维任务之外的环节:采集端的实时质检(用多视角一致性判断同步与标定是否异常)、自动标注(生成深度与位姿伪标签)、仿真资产生成(从真实序列重建带纹理场景)、以及为世界模型提供几何监督。这个趋势的含义是:几何模型的价值将越来越多地体现在它对数据管线的改造,而非它本身的重建精度

补充:关于"更大规模是否解决几何问题"的判断。 从现有证据看,规模扩展确实带来收益(VGGT-Ω 等后续工作把参数与数据规模推向十亿级),但收益主要集中在弱纹理与少视角等困难情形,而在需要绝对精度的任务上,标定与对齐的作用不可替代。换言之,规模提升的是鲁棒性上限,标定决定的是精度下限,两者不能互相替代。这一判断基于工程实践与公开消融,属于经验性结论而非严格对照实验

五、落地建议

  1. 1.把几何质量做成可交付的数字。 重投影误差、回环闭合误差、绝对尺度误差、多视角一致性,应作为数据卡的固定字段,并写入交付报告。这既是质量承诺,也是差异化卖点。
  2. 2.为前馈几何提供标定与锚点配套。 交付数据时同步交付内外参、时间偏移与标定不确定度,使客户无需重新标定即可使用。
  3. 3.针对工况做退化增强而非换模型。 把粉尘、反光、运动模糊建模进训练/微调数据增强,收益通常超过更换骨干。
  4. 4.建立三项自建评测。 度量一致性(与高精度真值对比)、视角鲁棒性(遮挡 1—2 路相机后的衰减曲线)、时序稳定性(连续 30 分钟的位姿与尺度漂移)。通用榜单只能作为上限参考。
  5. 5.把几何模型用作采集端的实时质检员。 前馈重建的一致性指标可实时判断当前帧序列是否存在同步或标定问题,把"事后筛"变成"事中导"。
  6. 6.按任务容差倒推几何指标,而非追求极限精度。 先确定任务的容差(如插入任务 ±0.5 mm、抓取任务 ±5 mm、导航任务 ±5 cm),再反推所需的尺度精度、标定残差与同步指标。精度每提升一个数量级,成本往往上升数倍;超出容差要求的精度不构成客户价值。
  7. 7.为动态物体设计单独的跟踪与评估分支。 在数据采集与几何质检中,把操作者手部、被移动物体与静态背景分开处理,避免动态区域污染静态几何的质量统计。多数几何质检失败案例的根源其实在这里,而非模型本身。
  8. 8.保留可重建的原始资产。 深度图与点云会随模型迭代而过时;保留原始多视角图像与相机参数,可在模型升级后重新生成几何,避免数据资产随算法进步而折旧。

六、对拓比科技的可执行启示

  • 硬件侧:μs 级硬同步 + 全局快门 + 刚性基线结构,是几何质量的前置条件;这些指标应作为产品的核心卖点并公开测试方法。
  • 数据侧:交付"几何质检报告"而非仅交付视频;报告应包含每批次的同步偏差、标定残差与重投影误差分布。
  • 生态侧:把标定文件格式与时间戳基准公开,让客户能在自己的算法栈里直接消费,而不是被锁在厂商工具链中。
配图方案

配图位置 4(全文末尾)|图像内容:从硬件到策略的传导链:μs 级硬同步 → 精确标定 → 前馈几何一致性 → 策略精度,每一环标注可量化指标。图注要求:图 4|几何质量的传导链:硬件指标最终以策略成功率的形式被客户感知。

来源与时间

VGGT(CVPR 2025 Best Paper,CO3Dv2 AUC@30 88.2%)及 VGGT-Ω 后续工作(2026);Depth Anything 3(ICLR 2026);SparseWorld-TC(CVPR 2026,Oral);DUSt3R/MASt3R(2024);MoGe-2 校准前后 REL 0.142→0.210(公开评测整理);北京人形 XR-1 UVMC 与 KL 对齐消融(ICML 2026)。

标注:跨工作指标不可直接比较,评测集与协议以原始论文为准;传导链中的量化关系为工程经验推断,非实验测量值。