定位与口径
本文基于本辑 10 篇前沿新闻所梳理的公开进展(截至 2026-09-08),给出技术判断、成熟度分层、关键瓶颈与自研优先级建议。所有判断均标注依据与置信度(高 / 中—高 / 中 / 中—低)。置信度定义:
- 高:有公开的第三方评测、行业标准或多家独立复现支撑;
- 中—高:有单一权威来源或两家以上企业的一致表述;
- 中:基于公开趋势的合理推断,缺少直接验证;
- 中—低:方向性判断,证据较弱或存在明显反向证据。
一、五条技术趋势判断
趋势一:端到端范式已稳定,竞争进入"效率 × 数据质量"的乘积阶段
依据:ICLR 2026 的 VLA 论文密度集中在记忆检索、token 剪枝、量化、跨本体软提示与统一扩散(公开论文汇总,2026-03);RoboDojo 榜单显示头部模型的绝对水平仍很低(2026-07 首批仿真 8.80% vs 人类 76.03%)。
判断:架构红利在 12 个月内被摊平,此后效果的差异主要来自两端——单位推理预算下的有效信息量,以及输入数据的信噪比。二者相乘,而非相加。
置信度:高。
对拓比的含义:我们无法影响客户的模型架构,但可以直接影响输入数据的信噪比(同步、标定、时间一致性、无效帧比例)。这是我们在客户价值链中真实可控的位置。
趋势二:三维几何被基础模型化,几何能力越强,硬件几何质量的杠杆越大
依据:VGGT(CVPR 2025 最佳论文)确立前馈三维重建;Depth Anything 3(ICLR 2026)用普通骨干统一几何任务并在多视深度与位姿上超越 VGGT;VGA(arXiv 2604.12908)以三维原生骨干在 LIBERO 取得最优操作精度。
判断:过去"算法会吃掉硬件误差"的预期正在反转——学习式几何对输入的时间一致性与标定精度极为敏感,尺度歧义(Sim(3))必须靠物理锚点消除。
置信度:高。
对拓比的含义:μs 级硬同步、全局快门、可追溯标定不是营销参数,而是客户策略精度的前置条件。建议把"同步精度—几何误差—策略成功率"的传导链做成可复现实验,作为最有力的技术营销材料。
趋势三:数据范式从遥操迁移到第一视角,采集端质量引导成为新增量
依据:EgoScale(ICML 2026)用 2.1 万小时第一视角数据 + 4 小时遥操实现灵巧操作,并观测到 log-linear 的灵巧性 scaling law;EgoGuide(arXiv 2606.14665)用 AR 在线覆盖度评分把质量引导前移到录制前。
判断:未来 12–24 个月,遥操在训练混合中的占比将降至可忽略;竞争要素转为单位小时成本 × 有效率。质量引导能把有效率从约 40% 提到 70%+,等价于成本减半。
置信度:中—高(scaling law 为单一工作的观测,跨团队复现仍在进行;有效率区间为经验估算)。
对拓比的含义:采集端实时质量反馈是最高性价比的研发方向——它不需要大模型团队,只需要边缘算力 + 几何指标 + 交互设计,且直接改善我们的单位经济。
趋势四:触觉与力控从"可选"变为"标配",多模态时间对齐成为硬指标
依据:HTT(arXiv 2606.29948)与 TactX(arXiv 2606.31236)在 2026 年 6 月底背靠背提出跨传感器共享潜空间;FTP-1 以 3000 小时、21 种传感器预训练实现跨本体迁移(+31pp);FARM(ICRA 2026)把夹持力显式纳入动作空间;Daimon-Infinity(2026-04)提供百万小时级含触觉数据。
判断:触觉数据的可聚合性被打通后,其规模化采集将复制视觉数据的路径;只含视觉的数据集在未来两年明显贬值。
置信度:中—高(跨传感器统一已有多方验证;但"标配化"的速度取决于传感器成本与标定便利度)。
对拓比的含义:采集设备应预留触觉/力通道与统一时间基准,并在数据卡中标注传感器型号、采样率与配对关系——这是未来接入共享潜空间的门票。
趋势五:世界模型的第一价值是"可观测的失败",而非"更聪明的规划"
依据:NVIDIA DreamZero 的经验观察——视频预测对了动作通常就对,视频开始幻觉动作往往就失败(NVIDIA 技术博客,2026);Fast-WAM(arXiv 2026)对"测试时想象是否必需"提出质疑;中科第五纪 FAM-1.3 的多视角未来视频预览显著提升不安全动作拦截率。
判断:把世界模型定位为安全校验层,半年内可产生可度量的事故率下降;定位为规划替代品,短期内难以跑赢高质量模仿学习。
置信度:中—高(相关性强弱依任务而异,缺少跨任务系统统计)。
对拓比的含义:可交付一份"时序一致性报告",用于说明本批数据适合世界模型训练;同时把重投影误差、位姿漂移等指标写入质检。
二、成熟度分层(TRL 式判断)
| 技术方向 | 成熟度 | 依据 | 关键瓶颈 | 拓比的姿态 |
|---|---|---|---|---|
| 端到端 VLA 架构 | 已规模化(9/10) | 多家企业发布可部署模型 | 长程记忆、精细操作、开放语义 | 不自研,做"模型友好"的数据供给 |
| 前馈三维几何(VGGT/DA3 类) | 可用(7/10) | 公开权重、多团队复现 | 尺度歧义、弱纹理/强反射、显存 | 采购 + 集成,用于数据质检与在线标定 |
| 世界模型 / WAM | 早期可用(5/10) | 单点突破,缺少统一评测 | 推理成本、想象必要性争议 | 观察 + 轻集成(安全校验层) |
| 第一视角数据规模化 | 已验证(8/10) | EgoScale scaling law、众包采集成形 | 有效率、合规、跨本体迁移 | 主战场:自研采集 + 质量引导 |
| 触觉跨传感器统一 | 早期(4/10) | 两篇同期工作 + FTP-1 | 硬件成本、配对数据稀缺 | 合作 + 预留接口 |
| Sim2real / real2sim2real | 中期(6/10) | Isaac/MuJoCo/Genesis 成熟 | 接触动力学、材质与摩擦逼真度 | 合作(与仿真平台方) |
| 灵巧手操作 | 中期(6/10) | 22 DoF 端到端已实现 | 数据稀缺、硬件可靠性 | 不涉足硬件,服务客户采集 |
| 长程记忆机制 | 早期(4/10) | 榜单显示巨大分差 | 缺少结构化长程数据 | 数据侧发力(阶段标注) |
三、三个关键瓶颈(按对我们的影响排序)
- 1.数据有效率(影响:直接决定单位成本)。当前大量采集数据因冗余、模糊、时序错乱而被丢弃。优先级最高,且在我们的能力半径内。
- 2.跨本体迁移(影响:决定数据的可复用性与市场规模)。异构数据若不能聚合,每个客户都要重新采集,规模效应无法形成。建议通过格式开放 + 元数据标准化缓解,而非自研迁移算法。
- 3.长程与记忆类数据稀缺(影响:决定数据集的差异化与溢价)。榜单已证明这是模型的主要短板,而市面上绝大多数数据只含短程成功轨迹。中等投入、高差异化回报。
四、自研优先级与技术路线
第一优先(0–6 个月,自研)
- •采集端实时质量引导:覆盖度评分、多视角同步状态提示、模糊/过曝检测;边缘端运行,反馈延迟 < 200ms。
- •几何质检流水线:基于前馈几何模型的重投影误差、点云一致性、位姿漂移自动计算,输出每批数据的质检报告。
- •在线标定与漂移监控:把内外参 + 时间偏移联合估计做成随设备交付的工具。
第二优先(6–12 个月,自研 + 开源)
- •格式与元数据标准:对齐 LeRobot / MCAP / RLDS,提供双向转换工具并开源;保留同步精度、标定文件、时间戳基准等扩展字段。
- •长程与失败样本采集协议:强制记录成功/失败/纠正三类样本,标注阶段边界与子目标依赖。
- •多模态时间基准统一:视觉、触觉/力、本体感知共用同一时钟源,并在数据卡中声明。
第三优先(12–24 个月,合作或轻投入)
- •触觉通道的标准化接入(与传感器厂商合作);
- •仿真侧 real2sim 接口(与平台方合作);
- •世界模型作为安全校验层的轻集成。
明确不做
- •不自研通用具身大模型:算力成本结构不支持,且会与客户形成竞争关系,损害中立性。
- •不涉足灵巧手/本体硬件:与我们的数据供给侧定位不符。
- •不自建超大规模仿真平台:生态已成熟,接入优于自建。
五、关键结论一览(含置信度)
| 结论 | 置信度 | 主要依据 |
|---|---|---|
| 数据信噪比将取代数据规模成为核心竞争维度 | 高 | 模型效率优化放大输入噪声;榜单绝对水平仍低 |
| 同步与标定质量可直接转化为客户策略成功率 | 中—高 | 几何基础模型对时间一致性敏感;Δx=v·Δt 换算 |
| 采集端质量引导可把有效数据成本压缩近半 | 中—高 | EgoGuide 覆盖度引导;有效率区间为经验估算 |
| 触觉进入标配通道的时间窗为 12–24 个月 | 中 | 跨传感器统一刚被验证;成本与标定仍是门槛 |
| 世界模型应优先作为安全校验层 | 中—高 | 视频—动作相关性观察;Fast-WAM 对必要性的质疑 |
| 长程/记忆类数据将在 12 个月内成为数据集标配维度 | 中—高 | RoboDojo 记忆维度分差;ICLR 2026 记忆论文密集 |
免责与维护:本文件为内部技术判断,所引进展均标注来源与时间;置信度随公开信息更新而变化,建议每季度复核一次。凡本文未标注来源的量化表述,均属推测性判断,不应直接对外引用。