返回新闻与洞察
视觉算法专项

多视角与触觉融合:把"看得见"扩展为"摸得着"

纯视觉方案在具身操作中的能力边界已经比较清晰:它能可靠地解决"物体在哪里、是什么、大致怎么抓",但在"抓稳了没有、力度是否合适、有没有打滑"这类接触状态判断上,视觉只能间接推断,且常被遮挡干扰。触觉与力觉提供了视觉…

2026-09-08
拓比科技视觉算法团队
视觉算法专项
数据标注平台与质量控制流程

摘要

纯视觉方案在具身操作中的能力边界已经比较清晰:它能可靠地解决"物体在哪里、是什么、大致怎么抓",但在"抓稳了没有、力度是否合适、有没有打滑"这类接触状态判断上,视觉只能间接推断,且常被遮挡干扰。触觉与力觉提供了视觉无法替代的直接接触信息,而多视角视觉则提供了单一视角丢失的空间完整性。两者的融合不是简单的模态堆叠,而是要在统一的时间基准与空间坐标下,把"接触前的位置预测"与"接触后的状态反馈"接成一个闭环。2025—2026 年的关键进展包括:触觉传感器的成本数量级下降(从数千美元级降至数百甚至百美元级)、触觉—视觉共享表征学习的出现(HTT、TactX)、大规模触觉数据集的开放(FTP-1、戴盟 Daimon-Infinity 百万小时级数据),以及把力/触觉信息直接纳入动作空间的方法(FARM,ICRA 2026)。本文梳理融合的技术路径、代表工作对比与落地建议。

配图方案

配图位置 1(摘要之后)|图像内容:操作时序横轴(接触前 → 接触瞬间 → 接触后保持 → 释放),上下两条带状通道分别标注"视觉信息可用性"与"触觉信息可用性",显示视觉在接触后被遮挡显著衰减、触觉在接触后跃升,中间用竖线标注"信息接力点"。图注要求:图 1|视觉与触觉的时间互补性:接触瞬间是信息主导权的交接点。

一、问题背景:视觉的三个盲区

盲区一:遮挡下的接触区不可见。 当手爪抓住物体时,接触区域恰恰被手爪与物体本身遮挡。用于抓取的腕部相机也常常因为距离与视角原因无法看清接触细节。这意味着在"最需要反馈的时刻",视觉信息最少。

盲区二:无法直接观测力学量。 视觉可以估计物体的形变(如软性物体被压缩的程度),但无法直接测量接触力、摩擦力与滑动。而这些量正是决定抓取成败的关键——抓得太松会滑落,太紧会损坏物体。

盲区三:缺乏材质与刚度的先验。 同样的抓取力度,对金属零件合适,对豆腐就会造成损坏。材质属性无法从单帧图像推断,需要交互才能获知,而触觉正是交互的直接产物。

触觉传感的三条技术路线各有定位:视触觉传感(如 GelSight 类,通过弹性体形变的光学成像反推接触几何与力)空间分辨率高、信息丰富;电容/电阻式阵列易于集成、耐用性好;磁性/光学式在柔性与成本上有优势。近年成本下降显著——从数千至上万美元级降到数百美元级,DIY 方案甚至可到百美元量级,这直接改变了触觉数据的可采集规模。

配图方案

配图位置 2(第一节末尾)|图像内容:三个盲区的示意图,每个盲区配一张对比图:遮挡(手爪握持时的遮挡区域)、力学量(视觉看不到力矢量)、材质(金属 vs 豆腐在相同力度下的不同结果)。图注要求:图 2|视觉的三个盲区:触觉的价值正对应于这三处缺口。

二、核心技术路径

2.1 触觉的表征学习:与视觉共享潜空间

触觉数据是高维(图像式视触觉或阵列式信号)且缺乏标注的,因此自监督表征学习成为主流。核心问题是:触觉表征应与什么对齐?

一种做法是触觉自编码(重建触觉信号),优势是不需要配对数据,缺点是学到的表征未必与任务相关。另一种更有前景的做法是跨模态对齐:把触觉信号与视觉、语言对齐到一个共享潜空间。代表工作包括 HTT(arXiv 2606.29948,2026-06-29,NUS + CMU,基于 HPT 的约 160 万配对帧、4 种传感器,分类 66.20%、力 MAE 0.636、滑移 F1 56.35,玩具螺丝任务 95%、豆腐任务 55%)与 TactX(arXiv 2606.31236,2026-06-30,UCSD + SNU + Amazon,16 维共享潜空间、3 个训练目标)。

跨模态对齐的实用价值在于:它让语言指令可以直接"检索"触觉模式(例如"轻轻握住"对应哪种触觉信号),从而使触觉信息可被 VLM/VLA 消费。

2.2 力/触觉进入动作空间

传统做法把触觉作为额外观测通道输入策略;另一种思路是把力/触觉定义在动作空间侧——即策略输出的不仅是位置,还包括期望接触力,由底层控制器实现。代表工作 FARM(ICRA 2026,GelSight Mini + UMI 组合)验证了这一路径的可行性。其优势是:策略的表达更自然(人类的操作意图本就包含力度),且力控的响应频率可以由底层控制器保证,不受视觉推理频率限制。

2.3 多视角融合:几何互补与遮挡消解

多视角(头戴双目 + 腕部相机 + 第三人称)的价值在于互补:头戴/第一人称视角贴近人类操作直觉、视野随注意力移动;腕部相机提供接触区近景;第三人称提供全局空间关系与遮挡消解。融合方式从早期的特征拼接,演进到基于 transformer 的跨视角注意力,再到把多视角几何约束(对极几何、多视图一致性)显式加入训练。

一个重要的工程判断是:视角数量的边际收益递减很快。从 1 路到 2—3 路提升明显,超过 6 路之后的收益主要来自特殊的遮挡工况,而成本(带宽、同步、标定复杂度)线性上升。因此应基于任务遮挡特性确定视角数,而非越多越好。

2.4 时间同步:融合的前提而非细节

所有多模态融合都建立在一个前提上:各模态共享统一的时间基准。相机与触觉/力传感器的采样率差异巨大(视觉 30—60 Hz,触觉可达数百 Hz,力矩可达 kHz),若没有硬件级的时间戳与触发对齐,融合的质量存在结构上限。这是一个"做对了看不见、做错了全盘皆输"的环节。

配图方案

配图位置 3(第二节末尾)|图像内容:融合架构图:多视角图像 → 视觉编码器;触觉/力 → 触觉编码器;两者在共享潜空间对齐 → 融合模块 → 策略头(位置 + 期望力);底部一条横向"时间基准"条贯穿所有模块。图注要求:图 3|融合架构的关键不在融合模块,而在贯穿始终的统一时间基准。

三、代表工作对比

工作模态核心方法公开指标时间
HTT视觉 + 触觉(4 种传感器)基于 HPT 的跨模态对齐,约 160 万配对帧分类 66.20%;力 MAE 0.636;滑移 F1 56.35;玩具螺丝 95%、豆腐 55%2026-06-29
TactX视觉 + 触觉16 维共享潜空间,3 个训练目标论文报告跨模态检索与迁移收益2026-06-30
FTP-1触觉 + 力 + 视觉大规模触觉预训练,约 3000 小时、26 个来源、21 种传感器;MTTS 24 token相对基线 +31 个百分点2025—2026
FARMGelSight Mini + UMI力定义在动作空间论文报告操作任务提升ICRA 2026
Daimon-Infinity(戴盟)触觉为主百万小时级数据、80+ 场景、2000+ 技能,开放 1 万小时数据规模为主要贡献2026-04
EgoScale 等第一人称工作第一人称视觉大规模第一人称预训练对数线性 scaling 规律ICML 2026

:所有指标来自各自论文或官方发布,任务、协议与传感器配置不同,绝对数值不可直接比较;部分工作为预印本,结论以最终版本为准。

四、挑战与趋势

挑战一:传感器异构性。 不同厂商、不同原理的触觉传感器输出格式与物理含义完全不同,导致触觉数据难以像图像那样跨来源混合训练。这是触觉领域相比视觉的结构性劣势。

挑战二:触觉数据的规模鸿沟。 视觉有互联网级数据,触觉没有。百万小时级的触觉数据(如戴盟 Daimon-Infinity)已经是行业顶级规模,但与视觉数据相比仍是数量级差距。

挑战三:触觉信号的退化与标定漂移。 弹性体老化、温度漂移会让触觉传感器的响应随时间变化,需要重新标定或域适应。这在长期部署中是实质问题。

趋势一:成本下降驱动数据规模跃升。 传感器价格从数千美元级降至数百甚至百美元级(DIY 方案约百美元量级),使大规模、多来源触觉采集成为可能。

趋势二:触觉从"可选模态"变为"精密操作的必需模态"。 在柔性物体、易碎物品、精密装配等任务上,纯视觉方案的成功率天花板已经显现。

趋势三:触觉与语言的对齐成为竞争焦点。 谁能把触觉翻译成可指令、可检索的语义,谁就掌握了把触觉接入 VLA 的入口。

配图方案

配图位置 4(第四节末尾)|图像内容:成本—规模双曲线:一条为触觉传感器均价随时间下降(数千 → 数百 → 百美元),另一条为可用触觉数据集规模随时间上升(千小时 → 十万小时 → 百万小时),两条线呈镜像。图注要求:图 4|成本下降与数据规模上升的镜像关系:触觉正在进入规模化前夜。

五、落地建议

  1. 1.先确定任务是否真的需要触觉。 刚性物体的抓取放置,纯视觉足够;柔性、易碎、精密插入、需要力度分级的任务才必须引入。避免为了"技术先进"增加系统复杂度。
  2. 2.把时间同步作为第一优先级。 统一硬件时间戳与触发信号,写入数据卡。这是所有融合工作的前提,事后无法弥补。
  3. 3.触觉传感器选型要考虑长期稳定性。 优先选择可更换弹性体、标定流程明确、有温漂补偿的型号;把"重新标定周期"作为选型指标之一。
  4. 4.为触觉数据设计统一中间表示。 即便跨传感器物理含义不同,也应定义一个与任务相关的中间层(如接触力方向、滑移概率、接触面积),使跨来源数据可混合。
  5. 5.同时采集视觉与触觉,而非只采触觉。 跨模态对齐方法的价值依赖于配对数据,单模态触觉数据的复用价值显著更低。
  6. 6.把力/触觉纳入标注体系。 至少标注:接触时刻、接触类型(点/线/面)、是否打滑、是否造成损伤。这几个字段成本极低但对下游价值极高。

六、对拓比科技的可执行启示

  • 硬件侧:多相机 + 可扩展触觉接口,是面向下一代具身数据采集的合理形态。关键不在当前是否标配触觉,而在于预留统一的时间基准与触发接口,使客户后续加装触觉传感器时无需重新设计同步架构。µs 级同步能力在此处从"视觉优势"扩展为"多模态优势"。
  • 数据侧:当前公开数据集中同时提供视觉、位姿与触觉/力配对的极少(RoboMIND 2.0 是少数同时含触觉、力与失败标签的数据集,约 31 万条轨迹、1000+ 小时、739 个任务、6 种本体)。多模态配对数据是明确的稀缺资源,比单纯增加视觉小时数更有战略价值。
  • 生态侧:定义并公开多模态数据的时间基准与配对格式。在多模态融合成为刚需但标准缺失的窗口期,参与标准制定是低成本、高回报的生态卡位。
配图方案

配图位置 5(全文末尾)|图像内容:稀缺性矩阵,横轴"数据类型"(纯视觉 → 视觉+位姿 → 视觉+触觉 → 视觉+触觉+力+失败标注),纵轴"公开数据可得性"(高→低),显示可得性随类型复杂度快速下降,同时叠加"训练价值"曲线上升。图注要求:图 5|稀缺性与价值的剪刀差:多模态配对数据是当前最被低估的资产。

来源与时间

HTT(arXiv 2606.29948,2026-06-29,NUS + CMU,HPT 约 160 万配对帧、4 种传感器;分类 66.20%、力 MAE 0.636、滑移 F1 56.35;玩具螺丝 95%、豆腐 55%);TactX(arXiv 2606.31236,2026-06-30,UCSD + 首尔大学 + Amazon,16 维共享潜空间、3 个目标);FTP-1(Sharpa + 清华 + UC Berkeley + 上海交大 + ETH,约 3000 小时、26 个来源、21 种传感器,MTTS 24 token,相对基线 +31 个百分点);FARM(ICRA 2026,GelSight Mini + UMI,力定义在动作空间);戴盟 Daimon-Infinity(2026-04,百万小时级触觉数据、80+ 场景、2000+ 技能,开放 1 万小时);RoboMIND 2.0(约 31 万条轨迹、1000+ 小时、739 个任务、6 种本体,含触觉、力与失败标签);EgoScale(ICML 2026,2.1 万小时第一人称预训练 + 50 小时动作捕捉 + 4 小时遥操作,<0.1% 遥操作比例,22 自由度,对数线性 scaling);触觉传感器价格区间(数千至上万美元 → 数百分美元 → DIY 约百美元量级,2025—2026 公开与市场信息整理)。

标注:价格区间为市场信息整理,因型号、批次与地区差异较大,具体数值待核实;跨工作指标不可直接比较;对"视角边际收益递减""多模态配对数据稀缺性"的判断属于工程经验推断前瞻研判