返回新闻与洞察
前沿观察

触觉的"基础模型时刻":从传感器割裂到共享潜空间

触觉的"基础模型时刻":从传感器割裂到共享潜空间

2026-09-08
拓比科技首席新闻官
前沿观察
相机标定与几何质检实验室场景

导语

机器视觉之所以能进入基础模型时代,前提是全世界相机的输出都是同一个东西——二维 RGB 阵列。触觉长期不具备这个前提:视触觉(GelSight 类)看弹性体形变,磁触觉读磁场变化,电阻阵列测压力分布,taxel 阵列输出时序向量——它们之间的差距接近"相机 vs 麦克风 vs 压力板",而非"iPhone 相机 vs 三星相机"。正因如此,触觉策略换个传感器就得重训,触觉数据无法跨实验室聚合。2026 年 6 月底,两篇背靠背的论文用几乎相同的思路打破了这一僵局:为每种传感器配一个轻量编码器,把所有模态投影进同一个共享潜空间。同期,首个通用触觉基础策略与百万小时级含触觉数据集相继出现——触觉终于等到了自己的基础模型时刻。

技术要点

HTT:异构触觉的统一骨干。 Heterogeneous Tactile Transformer(arXiv 2606.29948,2026-06-29,新加坡国立大学与卡内基梅隆大学等)构建了 Heterogeneous Paired Tactile(HPT)数据集,含 160 万同步配对的触觉帧,覆盖四种商用传感器:GelSight Mini 与 9DTact(光学)、Xela 与 TAC-02(阵列式)。"配对"指两种传感器装在同一夹爪上、同时观测同一次接触事件——这是跨模态对齐所需的关键监督信号。架构上,每种传感器配备专用编码器(光学用轻量 ViT、阵列用 CNN),后接共享 Transformer 主干,训练目标为逐模态掩码重建(保留传感器细节)+ 跨模态对齐(拉近同事件的不同传感器嵌入)。结果:物体分类总体准确率 66.20%、三维力估计 MAE 0.636、滑移检测 macro-F1 56.35;真实机器人上,玩具螺丝插入成功率 95%、豆腐抓取 55%,显著优于仅用关节角与力/力矩基线的方案。

TactX:跨物理原理的零样本迁移。 TactX(arXiv 2606.31236,2026-06-30,加州大学圣迭戈分校、首尔大学与 Amazon 等)处理更困难的版本:统一三种物理原理完全不同的传感器——Daimon(视触觉)、eFlesh(磁式)、FlexiTac(电阻式)。每种传感器各有编码器与解码器,但全部投影到同一个 16 维共享潜空间;三重目标联合训练:对比对齐(拉近配对接触事件)、自重建(潜变量可还原自身信号)、交叉重建(传感器 A 的潜变量能被传感器 B 的解码器解码)。第三项是关键——它迫使潜变量保留"接触语义"而非"传感器身份"。

FTP-1:通用触觉基础策略。 由 Sharpa 联合清华大学、UC Berkeley、上海交通大学、ETH Zurich 等提出,基于约 3000 小时、来自 26 个数据来源、21 种触觉传感器(7 种图像型、5 种阵列型、9 种状态量型)的数据预训练。核心是形态感知触觉词元空间(MTTS),把任意触觉输入映射到语义一致的 24 个手部功能区域 token;配合独立的触觉 Transformer 专家模块,避免干扰原有视觉-语言知识。结果是跨具身平台可迁移,在预训练未见过的传感器上成功率提升超过 31 个百分点。

成本墙被推倒。 触觉传感器价格在过去十年下降两个数量级:BioTac 类的 5000–10000 美元 → GelSight Mini 约 499 美元、与 Meta AI 合作的 DIGIT 约 350 美元 → 开源 GelSlim 自制约 122 美元。价格下降直接解锁了采集规模。

数据侧同步放量。 戴盟机器人(DAIMON)2026 年 4 月联合全球数十家机构发布 Daimon-Infinity 全模态数据集,规模达百万小时级,覆盖 80 余个真实场景、2000 余项人类技能,其中 1 万小时开源;其视触觉路线把触觉信息转换为图像格式,从而自然接入现有视觉 AI 框架,并由此提出把 VLA 扩展为 VTLA(Vision-Tactile-Language-Action)的概念。

关键突破

  • 跨传感器零样本迁移被实证:HTT 与 TactX 两条独立路线同时验证,触觉数据可以像视觉一样跨硬件聚合,这是触觉规模化的数据前提。
  • 触觉首次具备"基础模型 + 大规模数据集"的组合:FTP-1 提供可复用策略,Daimon-Infinity 提供语料,二者互补。
  • 工程化方法同步成熟:FARM(ICRA 2026)用改装的 UMI 手持夹爪集成 GelSight Mini 采集人类演示,策略同时预测位姿、夹持宽度与夹持力,在高力/低力/动态力三类任务上优于基线——力被显式纳入动作空间,而非夹持指令的副产品
  • 触觉数据开始被证明能直接改善产线指标:公开案例显示,在工业机床上下料任务中引入强化学习后吞吐提升 42%、交接任务成功率从 80% 升至 98%、双臂料箱搬运从 78% 升至 99%,而残余失败主要来自接触细节——触觉正是补齐这一环的关键。

对产业的影响

第一,触觉从"可选配件"变为"数据资产"。当触觉可以与视觉在同一潜空间中被处理(VTLA),多模态采集设备的价值从"多一个传感器"升级为"多一个模态的数据资产"。采集设备厂商应把触觉通道纳入标准化设计,并同步记录时间戳与标定参数。

第二,跨传感器统一潜空间降低了数据聚合门槛,意味着拥有多型号传感器采集能力的一方,其数据的可复用性与议价能力更高。建议在数据卡中显式标注传感器型号、采样率与配对关系,便于未来接入共享潜空间。

第三,力/触觉标注将成为新的质量维度。行业数据集过去主要标注视觉与轨迹,触觉、力/力矩、失败标签的覆盖率正在成为差异化指标(RoboMIND 2.0 已含触觉与失败示范标签)。对采集方而言,这既是技术门槛,也是溢价来源。

配图建议

图 1(放置:导语之后)

  • 画面描述:四种/三类触觉传感器的并列实物示意与输出形态对照:视触觉(弹性体形变图像)、磁式(磁场矢量变化)、电阻式(压力热图)、taxel 阵列(时序曲线)。每种下方用小字标注"测量物理量不同 → 无法直接聚合",右侧用红色叉号表示"传统方案:一一配对重训"。
  • 图注:图 1|触觉传感器的异构性:测量原理不同导致数据无法直接聚合(GelSight / Xela / 9DTact / TAC-02 / Daimon / eFlesh / FlexiTac 等)。

图 2(放置:"技术要点"中 TactX 段落后)

  • 画面描述:共享潜空间架构图。左侧三个不同形状的传感器输入块(图像、磁场、电阻),各自经专用编码器(不同颜色小方块)投影到中间同一个 16 维/统一潜空间球体;从球体出发三条箭头分别指向"对比对齐""自重建""交叉重建"三个训练目标;右侧输出策略头。
  • 图注:图 2|HTT / TactX 的共享触觉潜空间:专用编码器 + 统一主干 + 三重对齐目标(架构示意,维度以原论文为准)。

图 3(放置:"关键突破"最后一条之后)

  • 画面描述:价格下降阶梯图(对数刻度):BioTac 类 $5,000–10,000 → GelSight Mini $499 / DIGIT ≈$350 → 开源 GelSlim 自制约 $122。右侧配一个"传感器数量 × 采集小时数"的增长箭头,说明成本下降如何解锁规模。
  • 图注:图 3|触觉传感器价格在十年间下降两个数量级,采集规模的前提被打通(价格为公开报价区间,随渠道与批量浮动)。

来源与时间

  • HTT / Heterogeneous Paired Tactile(HPT)数据集:arXiv 2606.29948,2026-06-29,NUS 与 CMU 等。
  • TactX:arXiv 2606.31236,2026-06-30,UCSD、SNU 与 Amazon 等。
  • FTP-1:Sharpa 联合清华大学、UC Berkeley、上海交通大学、ETH Zurich(2026,公开发布)。
  • Daimon-Infinity:戴盟机器人联合多机构,2026-04 发布,部分开源(1 万小时)。
  • FARM / Tactile-Conditioned Diffusion Policy:ICRA 2026,TU Darmstadt 等。
  • 传感器价格区间:公开报道整理(2026);工业产线强化学习提升数据来自 Humanoid 公开报告(2026)。

标注说明:HTT/TactX/FTP-1 的指标均引自原论文自报结果,评测协议与硬件配置不同,跨工作横向比较需谨慎;价格区间随渠道与批量浮动,属参考值。工业提升数据为企业案例口径,非第三方审计结果(待核实)。