返回新闻与洞察
前沿观察

视觉与几何的"基础模型化":CVPR 2026 与空间智能的成熟

视觉与几何的"基础模型化":CVPR 2026 与空间智能的成熟

2026-09-08
拓比科技首席新闻官
前沿观察
TOBI E2 双目具身采集设备实物

导语

具身智能需要的不是"识别这是什么",而是"它在哪里、离多远、往哪个方向能动"。2025–2026 年计算机视觉领域最重要的结构性变化,是三维几何本身被基础模型化——从 CVPR 2025 最佳论文 VGGT 确立前馈式三维重建范式,到 ICLR 2026 的 Depth Anything 3 用极简骨干统一几何任务,再到 CVPR 2026 上占据预测与空间推理的 Oral 工作,一条清晰的主线是:几何正在从"后处理工序"变成"可预训练、可迁移、可端到端调用的表征"。这条线对具身智能的影响可能比任何一个新 VLA 都更深远。

技术要点

前馈式三维重建:从优化到一次前向。 VGGT(Visual Geometry Grounded Transformer,CVPR 2025 最佳论文)主张:把整个图像集合一次性输入 Transformer,一次前向直接输出相机内外参、稠密深度、点图与三维点轨迹,无需迭代优化或全局对齐后处理。其核心是交替注意力——偶数层做帧内局部注意力,奇数层做跨帧全局注意力——使全局一致性由网络结构保证,而非事后优化。相比 DUSt3R/MASt3R 需要逐对预测再全局拼接,VGGT 原生支持 1 到数百视角,速度从 SfM 的分钟级压缩到秒级;在 CO3Dv2 上位姿估计 AUC@30 达 88.2%。后续 VGGT-Ω(约 10B 参数)显示误差随模型与数据规模呈幂律下降。

极简主义的胜利:Depth Anything 3。 DA3(ICLR 2026)给出相反但同样有力的答案:一个未经架构特化的普通 DINOv2 骨干 + 统一的"深度-射线(depth-ray)"表示即可,无需复杂多任务学习。DualDPT 双分支同时预测逐像素深度与射线(含置信度),因深度与射线本质上是同一几何量的两种表达,模型可通过简单逐元素操作合成空间一致的点云。DA3 在单目深度上显著超越 DA2、多视深度与位姿上超越 VGGT,并可直出三维高斯。DA3-Streaming 以滑窗流式推理处理超长序列,显存低于 12GB。

占据预测与空间推理进入主流。 CVPR 2026 的 Oral 工作 SparseWorld-TC 突破传统鸟瞰图投影,用稀疏 token 端到端预测多帧三维场景占据,为具身导航与规划提供更高效表征;ICLR 2026 的 SpinBench 则以三维旋转为切口系统评测视觉语言模型的空间推理能力。这类"空间智能"的量化评测,是几何能力进入工程化阶段的标志。

三维原生骨干进入机器人控制。 VGA(arXiv 2604.12908)主张直接用预训练三维世界模型作为机器人控制骨干,避免把三维信息压回二维隐空间的"3D→2D→3D"病态变换环;通过渐进体积调制(PVM)把结构化几何表征注入动作解码,并联合训练动作头/相机头/深度头、推理时解耦,在 LIBERO 上取得当前最优操作精度。

关键突破

  • 几何从"工序"变成"表征":一次前向即可获得位姿、深度、点图与轨迹,且可微、可端到端训练。
  • 极简架构跑赢专用设计:DA3 证明通用骨干 + 统一表示足以覆盖多类几何任务,降低了工程门槛。
  • 几何 token 开始进入策略网络:VGA 把几何表征作为动作解码的条件,验证了"空间智能"对精细操作的直接价值。
  • 空间推理有了专门评测:SpinBench 一类基准的出现,意味着几何能力开始被独立量化,而非隐含在下游任务中。

对产业的影响

第一,模型的几何能力越强,输入数据的几何质量就越关键。前馈几何的尺度歧义(Sim(3))需要外部锚点(标定物、已知基线、LiDAR)才能转为米制;多相机的时间偏移会让外参标定在运动场景下失真。因此"μs 级硬同步 + 全局快门 + 可追溯标定"从硬件指标升级为算法性能的前置条件。

第二,几何能力可被用作数据质检工具。前馈重建的重投影误差、点云一致性、位姿漂移,都可作为采集数据的客观质量指标,且可自动化、可写进交付报告。

第三,占据/稀疏表征的成熟会降低对视角数的依赖,但会提高对视角几何关系准确性的要求——视角少而准,优于视角多而乱。

配图建议

图 1(放置:导语之后)

  • 画面描述:三代三维重建范式对比三栏图。左"优化式 SfM":特征匹配 → 增量注册 → 光束法平差 → MVS,标注"分钟—小时级、不可微";中"点图回归(DUSt3R/MASt3R)":逐对 pointmap + 全局对齐,标注"可微但有累积误差";右"前馈统一(VGGT/DA3)":多视角一次前向 → 位姿/深度/点图/轨迹,标注"秒级、全局一致"。
  • 图注:图 1|三维重建范式的三代演进:从优化到前馈(VGGT 为 CVPR 2025 最佳论文)。

图 2(放置:"技术要点"中 DA3 段落后)

  • 画面描述:DA3 的 DualDPT 结构简图。输入图像经 DINOv2 骨干提取多尺度特征,进入共享特征金字塔融合,随后分为两个分支:主分支输出深度 + 置信度,辅助分支输出射线 + 置信度;两个分支的逐元素操作合成三维点云;右侧三个可选输出挂件:相机位姿、三维高斯、度量对齐。
  • 图注:图 2|Depth Anything 3 的深度-射线统一表示与多任务输出(ICLR 2026,结构依据公开实现整理)。

图 3(放置:"对产业的影响"第一条之后)

  • 画面描述:同步误差级联图。顶部"多相机时间偏差 Δt",中部公式"Δx = v · Δt"(v 为手/物运动速度),下方三个递进方块:立体匹配伪影 → 点云分层/重影 → 几何监督信号带噪 → 策略精度上限被压低。右侧标注"硬件同步 ≤100μs 对应亚毫米级;软件时间戳 5–30ms 对应厘米级"。
  • 图注:图 3|时间同步误差如何级联为策略精度损失——几何能力越强的模型,越受制于输入的同步质量。

来源与时间

  • VGGT: Visual Geometry Grounded Transformer(CVPR 2025 Best Paper);VGGT-Ω 后续工作(2026);CO3Dv2 位姿 AUC@30 88.2%。
  • Depth Anything 3: Recovering the Visual Space from Any Views(ICLR 2026);DA3-Streaming(2025-12 发布)。
  • SparseWorld-TC(CVPR 2026,Oral);SpinBench(ICLR 2026);MERL 相关空间推理工作(NeurIPS 2025 workshop / ICLR 2026)。
  • VGA: Robotic Manipulation is Vision-to-Geometry Mapping(arXiv 2604.12908)。
  • 小鹏在 CVPR 2026 公开世界模型技术蓝图(公开报道,2026)。

标注说明:各模型的指标引自原论文自报,评测集与协议不同,跨工作横向比较需谨慎;CVPR 2026 的完整接收列表与 Oral 名单以会议官方为准(待核实)。同步误差换算(Δx = v·Δt)为运动学基本关系,非实验测量值。