摘要
单目深度估计与三维重建在过去五年完成了从"学术问题"到"工程组件"的转变。以 Depth Anything 系列、DUSt3R/MASt3R、VGGT 为代表的工作,把深度估计从"受限于特定数据集的有监督回归"变成了"可零样本泛化的几何基础模型",把多视图重建从"耗时的逐场景优化"变成了"一次前向推理"。但对具身智能与工业应用而言,论文榜单上的 RMSE 与产线上的可用性之间存在一条显著的鸿沟:绝对尺度不可靠、透明与反光物体系统性失效、动态物体造成鬼影、算力与延迟约束严苛、以及最关键的——缺乏对不确定度的输出。本文从工程化视角梳理深度与重建技术,重点讨论尺度、工况退化、时序一致性与量化部署四个实际问题,并给出面向具身数据采集与交付的具体建议。
配图位置 1(摘要之后)|图像内容:双栏对照图,左栏"论文评测环境"(干净光照、静态场景、有纹理、有真值),右栏"真实工况"(反光金属、透明包装、运动模糊、粉尘、无真值),中间用一道裂缝分隔并标注"工程化鸿沟"。图注要求:图 1|从榜单到产线:深度估计工程化要跨越的四道坎(尺度、退化、时序、算力)。
一、问题背景:为什么"看起来很准"的深度模型在产线上不好用
问题一:绝对尺度缺失。 单目深度模型本质上是仿射不变的——它能告诉你"物体 A 比物体 B 远两倍",但无法可靠告诉你"A 距离相机 47.3 厘米"。这是因为单目深度的训练监督多为相对深度或尺度归一化深度。对机器人抓取而言,尺度错误是致命的:如果估计的深度是真实值的 1.2 倍,那么机械臂会在到达物体前 20% 的距离处就闭合夹爪。
解决尺度问题有三条路:使用带真实尺度的传感器(双目、ToF、激光)作为锚;使用已知尺寸的参照物标定;或使用本身输出度量深度的模型(部分模型通过训练时引入相机内参与真实尺度监督来实现)。实践中,纯单目方案难以满足精密操作需求,这也是具身采集设备普遍采用双目或多目的根本原因之一。
问题二:工况退化。 玻璃、镜面金属、透明塑料膜、黑色吸光材料、强反光焊缝,这些在工业场景中极为常见,却是被动视觉的系统性失效点。深度模型在这些区域会给出自信但错误的预测。
问题三:动态与运动模糊。 采集设备在移动、物体在被操作时,图像存在运动模糊;多视图重建假设场景静止,动态物体会造成鬼影与几何污染。
问题四:没有不确定度。 大多数深度模型输出一个数值,不告诉使用者"这个数值有多可信"。而在机器人系统中,决策层需要知道何时该信任视觉、何时该切换到其他传感器或请求人工介入。缺乏不确定度输出,使得深度模型难以被集成进安全相关的控制回路。
配图位置 2(第一节末尾)|图像内容:四类失效案例图,每类配"真实场景照片示意 + 模型输出的伪彩深度图 + 红色高亮的错误区域":透明容器(深度穿透)、反光金属(深度跳变)、运动模糊(边缘糊化)、无纹理白墙(深度平面化)。图注要求:图 2|四类典型工况失效:错误往往伴随着高置信度,这是最危险的部分。
二、核心技术路径
2.1 单目深度:从有监督回归到基础模型
早期方法在特定数据集上做有监督回归,泛化能力差。转折点来自两方面:其一是大规模自监督与伪标签训练(用单目视频的时序一致性、或多模型集成生成伪标签),代表性工作如 Depth Anything 系列;其二是用强大的预训练视觉骨干(DINOv2 等)作为编码器,使模型继承丰富的语义与结构先验。
Depth Anything 3(ICLR 2026)的取向值得注意:它采用简洁的普通 DINOv2 骨干配合深度—射线表示,主张结构简化与可流式处理(DA3-Streaming 显存占用低于 12 GB),反映出该领域从"堆模块"回归"简洁可扩展"的趋势。
2.2 双目与多目:几何约束带来的度量能力
双目立体匹配通过极线约束直接求解视差,其优势是天然具备绝对尺度(只要基线已知且标定准确),且不依赖学习先验,对未见过的物体依然可靠;劣势是在无纹理区域(白墙、纯色包装)无法匹配,且精度随距离平方衰减。
近年主流做法是学习与传统方法的融合:用学习模型提供稠密先验与无纹理区域的补全,用几何约束保证度量正确性与跨场景泛化。这种"几何 + 学习"的混合方案在工业落地中最为稳妥。
2.3 前馈多视图重建:从优化到一次推理
传统 SfM/MVS 流程需要对每个场景做耗时的特征匹配与全局优化,一个中等规模场景可能要数分钟到数小时。前馈方法(DUSt3R/MASt3R,2024;VGGT,CVPR 2025 Best Paper)把这一过程压缩为一次神经网络前向:输入多张图像,直接输出点云、深度与相机位姿。VGGT 采用交替注意力机制,在 CO3Dv2 上达到 AUC@30 88.2%。
前馈方法的价值不只是速度,更重要的是可微分与可批处理:它使得三维重建可以被嵌入训练流程(如作为数据质检工具或作为世界模型的监督信号),这在传统优化方法中是不可能的。
2.4 稀疏化与效率:让三维理解进入实时预算
稠密三维表示的计算成本随分辨率立方增长。2026 年的一个重要方向是稀疏 token 化:不处理所有像素/体素,而是只处理信息量大的区域。代表工作 SparseWorld-TC(CVPR 2026,Oral)把时序稀疏 token 引入占据预测,显著降低计算量。另一条路线是三维原生骨干(如 VGA,arXiv 2604.12908),直接在三维空间设计主干网络与位置编码,避免二维到三维的转换损耗。
配图位置 3(第二节末尾)|图像内容:技术路径决策图,根据三个判断(是否需要度量尺度 / 是否有多视角 / 是否要求实时)导向不同方案:单目基础模型(否/单/任意)、双目几何(是/双/是)、前馈多视图重建(是/多/否-近实时)、混合方案(是/多/是)。图注要求:图 3|深度与重建的选型树:是否需要绝对尺度是第一分叉点。
三、代表工作对比
| 工作 | 类型 | 输入 | 输出 | 关键指标/特性 | 时间 |
|---|---|---|---|---|---|
| Depth Anything 系列 | 单目深度 | 单图 | 相对/度量深度 | 零样本泛化强 | 2024—2025 |
| Depth Anything 3 | 单目/多目深度与位姿 | 单/多图 | 深度 + 射线表示 + 位姿 | 结构简洁;DA3-Streaming 显存 <12 GB | ICLR 2026 |
| DUSt3R / MASt3R | 前馈双视图重建 | 2 图 | 点云 + 位姿 | 无需相机参数 | 2024 |
| VGGT | 前馈多视图几何 | 多图 | 位姿 + 深度 + 点云 | CO3Dv2 AUC@30 88.2% | CVPR 2025 Best Paper |
| VGGT-Ω 等后续 | 大规模扩展 | 多图 | 同上 | 规模扩展方向 | 2026 |
| SparseWorld-TC | 稀疏时序占据 | 多帧多视图 | 占据预测 | CVPR 2026 Oral;稀疏 token 降本 | 2026 |
| VGA | 三维原生骨干 | 多视图 | 三维特征 | LIBERO 上 SOTA | arXiv 2604.12908 |
| MoGe 系列 | 单目几何 | 单图 | 度量深度 + 法向 + 相机 | 开源评测中 REL 相关对比被广泛引用 | 2024—2025 |
| 传统 SfM/MVS | 优化式重建 | 多图 | 稀疏/稠密点云 | 精度高、无学习依赖 | 经典 |
注:所有指标来自各自论文与公开评测,评测集、协议与硬件不同,绝对数值不可直接比较;MoGe 系列的 REL 数值在不同公开整理中差异较大,具体数值待核实。
四、挑战与趋势
挑战一:评测集与真实工况的分布差异。 主流评测集(如 CO3Dv2、NYU、KITTI)以日常与驾驶场景为主,与工业工况(反光、透明、粉尘)分布差异大。在榜单上的排名不能作为产线选型的唯一依据。
挑战二:不确定度校准缺失。 模型输出的高置信度错误比低置信度错误危险得多。当前研究对深度估计的校准(calibration)关注不足。
挑战三:时序一致性。 逐帧独立的深度估计在视频中会闪烁,这对依赖稳定深度的控制回路是灾难。时序一致性与精度之间存在张力:强制平滑会拖慢对真实变化的响应。
趋势一:从相对深度走向度量深度。 具身应用对绝对尺度的刚需,正在把"度量深度"从附加功能变成基本要求。
趋势二:几何先验重新受到重视。 在学习方法主导数年后,显式几何约束(对极几何、多视图一致性、相机模型)正在回归,因为它们是泛化能力最可靠的来源。
趋势三:前馈重建成为数据管线的基础设施。 不只用于重建本身,更用于数据质检、自动标注与世界模型监督。
配图位置 4(第四节末尾)|图像内容:三维能力渗透图:中心"前馈重建模型",向外辐射五条箭头(数据质检 / 自动标注 / 仿真资产生成 / 世界模型监督 / 策略输入),每条标注成熟度(已可用 / 试点中 / 研究中)。图注要求:图 4|前馈重建的真正价值不在重建本身,而在它成为数据管线的基础设施。
五、落地建议
- 1.明确是否需要绝对尺度。 如果需要度量深度且精度要求高,应当采用双目/多目硬件方案或引入尺度锚点,而不是寄望于单目模型。
- 2.把工况退化做成测试集而非意外。 为每类工况(透明、反光、粉尘、运动模糊)建立专门的测试子集,并在选型时以子集指标而非整体指标决策。
- 3.要求输出不确定度。 若自研模型,加入深度不确定度头;若采购方案,把"是否提供置信度图"作为硬性选型条件。
- 4.时序一致性优先于单帧精度。 对视频应用,逐帧的高 RMSE 不如稳定的相对结构。评估时应加入时序抖动指标(相邻帧深度图在同一静止区域的方差)。
- 5.算力预算要按峰值而非平均估算。 前馈多视图模型的显存随输入帧数增长,应按最大帧数场景评估,并考虑流式/分块方案。
- 6.保留原始与中间结果。 深度图会随模型迭代而过时,保留原始图像与相机参数,可在模型升级后重新生成,避免数据资产折旧。
六、对拓比科技的可执行启示
- •硬件侧:双目在度量能力上具有结构性优势。单目方案无法自证尺度,而具身操作的成败高度依赖精确距离。因此双目/多目不只是"多一个视角",而是从"相对几何"跨越到"度量几何"的分界线。硬件设计应突出:刚性基线(保证外参稳定)、全局快门(消除运动畸变)、µs 级同步(保证多视图一致性)、全温标定(保证跨时段尺度稳定)。
- •数据侧:交付"带几何质量报告的深度/点云数据",而非仅交付原始视频。报告应含:多视图一致性、重投影误差分布、尺度校验结果(与已知尺寸物体对比)、以及退化区域标注(哪些区域是透明/反光导致的不可信区)。这类元数据是当前数据市场的空白。
- •生态侧:把相机内参、外参、时间戳基准与不确定度约定公开成规范文档,让客户可以直接把数据接入自己的重建与训练栈。标准越早参与,切换成本壁垒就越高。
配图位置 5(全文末尾)|图像内容:交付物升级路径:第一层"RGB 视频"(可被替代)→ 第二层"+ 相机参数与同步信息"(可训练)→ 第三层"+ 深度/点云与不确定度"(可直接用于几何任务)→ 第四层"+ 几何质检报告与退化标注"(可用于安全相关场景)。图注要求:图 5|从卖视频到卖可信几何:每一层都对应一次价值跃迁。
来源与时间
Depth Anything 系列(2024—2025)与 Depth Anything 3(ICLR 2026,含 DA3-Streaming 显存 <12 GB);DUSt3R / MASt3R(2024);VGGT(CVPR 2025 Best Paper,交替注意力,CO3Dv2 AUC@30 88.2%)与 VGGT-Ω 后续工作(2026);SparseWorld-TC(CVPR 2026,Oral);VGA(arXiv 2604.12908,三维原生骨干,LIBERO 上 SOTA);MoGe 系列(2024—2025,公开评测整理中 REL 相关数值存在版本差异);SpinBench(ICLR 2026);北京人形 XR-1 的 UVMC 与 KL 对齐消融(ICML 2026)。
标注:跨工作指标不可直接比较;MoGe 的 REL 数值在不同公开整理中存在差异,待核实;对"双目是度量几何分界线""前馈重建将成为数据管线基础设施"的判断属于工程经验推断与前瞻研判。