摘要
可供性(affordance)概念由生态心理学家吉布森提出,指环境为行动者提供的"可行动可能性"——一把椅子提供了"坐"的可能,一个把手提供了"握持并拉动"的可能。在机器人视觉中,可供性预测的任务是:给定图像(或点云)与一条任务指令,输出场景中每个位置/物体可供执行哪种动作、以及该动作应如何执行的稠密或结构化预测。它是连接"看懂场景"与"做出动作"的中间层,也是当前具身视觉中产业化程度最低、但潜在杠杆最大的方向之一。本文梳理可供性预测从几何启发式到数据驱动稠密预测的演进,对比接触点预测、可供性地图、功能基元与语言条件可供性四类方法,分析其在数据集构建上的特殊要求,并给出面向具身数据供应商的落地建议。
配图位置 1(摘要之后)|图像内容:三层金字塔图:底层"语义分割/检测"(这是什么)、中层"可供性预测"(能干什么、怎么干)、顶层"动作生成"(具体轨迹);用箭头标注自下而上的信息流与自上而下的任务约束。图注要求:图 1|可供性在操作栈中的位置:它把"是什么"翻译成"能做什么"。
一、问题背景:从"识别"到"操作"之间缺失的一环
假设机器人看到桌面上有一把螺丝刀。目标检测会输出"螺丝刀,bbox=[x,y,w,h]";语义分割会给出像素级掩码;姿态估计会给出 6-DoF 位姿。但要把螺丝拧进去,机器人还需要知道:应该握持哪个部位(手柄而非金属杆)、握持时手爪应以什么朝向接近、施力的方向轴是什么(沿螺丝轴向旋转)、接触点在哪里(刀头与螺丝槽的啮合位置)。这些信息无法从边界框中读出,正是可供性预测要解决的问题。
早期做法是几何启发式:人工为每类物体定义抓握基元与作用轴。这个方法在结构化产线上有效,但每新增一类物体就要重新定义,本质上不可扩展。
第二条路径是从交互中学习:让机器人随机尝试抓取,把成功/失败作为监督信号。代表工作包括早期的自监督抓取数据集(如以数万次抓取尝试著称的 Google 抓取实验)。这条路线的物理可靠性高,但采集成本巨大,且难以覆盖长尾物体。
第三条路径是当前主流——从人类视频与遥操作数据中学习可供性。人类在操作物体时,手部与物体的接触点、接近方向、作用轴天然地为可供性提供了稠密标注;第一人称视频因此成为可供性预测最自然的数据来源。这也解释了为什么 2025—2026 年可供性研究的重心明显转向以自我中心(egocentric)数据为核心。
一个关键但常被忽视的问题是:可供性是任务相关的。同一个马克杯,任务为"倒水"时其可供性在杯口与把手,任务为"收纳"时其可供性在杯身的可抓握圆柱面,任务为"清洗"时可供性转移到内壁。这意味着可供性标注必须绑定任务,通用"物体可供性图"的概念在严格意义上是病态的。
配图位置 2(第一节末尾)|图像内容:同一个马克杯在三种任务指令(倒水 / 收纳 / 清洗)下的热力图对比,高亮区域分别位于杯口+把手、杯身圆柱面、内壁。图注要求:图 2|可供性的任务依赖性:脱离任务谈"物体的可供性"是病态的。
二、核心技术路径
2.1 接触点与抓握姿态预测
最工程化的一条路线,输出为"抓取点 + 抓取角度 + 夹爪宽度"。经典工作以二维平面抓取为主(在俯视深度图上预测抓取矩形),后续扩展到六自由度抓取。其优势是输出可直接对接运动规划,劣势是只能表达"抓取"这一种交互,无法表达"旋拧""按压""倾倒"。
2.2 稠密可供性地图
把可供性建模为与图像同分辨率的稠密图,每个像素的值表示在该处执行某类动作的成功概率或适配度。这条路线受益于视觉语言模型的进步:可以用 CLIP 类模型或开放词汇分割模型为像素分配语义,再与动作类别做关联,形成开放词汇的可供性预测。代表思路包括基于视觉语言模型的可供性推理与"从人类视频中定位接触点"的方法。
2.3 功能基元与关键点
介于两者之间的折中路线:不预测稠密图,而是预测一组语义明确的关键点或功能基元(如"旋转轴""拉手中心""按压面法向")。这类表示的可解释性强、对数据量要求低,且天然对接下游的约束型运动规划,在工业场景中实用性最好。
2.4 语言条件可供性与"先指后动"
2026 年出现的一组工作把可供性预测显式化为指向(pointing)这一中间表示:给定语言指令,模型先在图像上指出目标位置或接触点,再由独立的动作模块执行。代表工作包括 Embodied-R1(在 SIMPLEREnv 上 56.2%、8 项 XArm 任务 87.5%、相对基线 +62%)以及同期关于空间接地的一组研究(Spatial Forcing、From Spatial to Actions、PixelVLA)。
这条路线为何有效?因为它把"理解任务"与"生成动作"解耦:指向任务的监督信号远比动作轨迹稠密(一个点 vs 一串关节角),数据效率更高;同时指向结果可以被人直接检查,可解释性大幅改善。从数据角度看,指向标注的成本远低于动作轨迹标注,这为数据集构建提供了一条低成本扩容路径。
配图位置 3(第二节末尾)|图像内容:四类可供性表示的对照示意,从左到右依次为:抓取矩形、稠密热力图、关键点/作用轴、指向箭头;下方标注各自的标注成本、可解释性与下游对接难度。图注要求:图 3|可供性表示的四种形态及其工程权衡。
三、代表工作对比
| 路线 | 表示形式 | 监督来源 | 优势 | 局限 | 成熟度 |
|---|---|---|---|---|---|
| 几何启发式 | 人工定义基元 | 无学习 | 确定性、可验证 | 不可扩展 | 成熟但受限 |
| 自监督交互 | 抓取成功/失败 | 真机试错 | 物理可靠 | 采集成本极高 | 成熟 |
| 二维平面抓取 | 抓取矩形 | 抓取标注 | 工程可用、易部署 | 仅限俯视抓取 | 成熟 |
| 六自由度抓取 | 抓取位姿 | 仿真/真机标注 | 覆盖多种朝向 | 标注与验证复杂 | 较成熟 |
| 稠密可供性图 | 像素级热力图 | 人类视频/遥操作 | 表达力强、可开放词汇 | 标注噪声大 | 活跃研究中 |
| 功能基元/关键点 | 语义关键点 | 人工/半自动标注 | 可解释、数据高效 | 需预定义基元集 | 工业可用 |
| 语言条件指向 | 点/框 | 点标注 | 标注成本低、可解释 | 需下游动作模块 | 2026 新兴 |
注:成熟度分级为本文基于公开文献与产业实践的主观评估,非行业标准。上表数值指标来自各自论文,协议不同不可比较。
四、挑战与趋势
挑战一:标注成本与一致性。 稠密可供性的真值本质上需要人类的意图判断,众包标注的一致性显著低于语义分割——不同标注员对"哪里适合握持"的判断差异很大。这导致可供性数据集的规模长期受限。
挑战二:从视觉可供性到力控执行的鸿沟。 知道"应该握持把手"不等于知道"用多大力握持"。可供性预测输出的是几何与语义层面的信息,而实际执行的成功率高度依赖接触力、摩擦系数与物体刚度,这些属性无法从纯视觉推断。
挑战三:长尾物体与 unseen 类别。 训练时未见过的物体类别上,可供性预测的退化速度远快于目标检测——因为可供性依赖的是物体功能的常识,而非常见的视觉外观。
趋势一:可供性与 VLA 的融合。 "先指后动"路线实际上把可供性预测嵌入了 VLA 内部,两者界限正在模糊。
趋势二:触觉反馈参与可供性修正。 接触后通过触觉判断抓握是否稳定,并实时调整接触点,是提升鲁棒性的必然方向(详见多视角与触觉融合一篇)。
趋势三:从人类第一人称视频规模化挖掘可供性。 人类的手部接触点是可用的弱监督信号,其规模远超遥操作数据,这是可供性数据扩容成本最低的路径。
配图位置 4(第四节末尾)|图像内容:闭环反馈图:视觉可供性预测 → 抓取执行 → 触觉/力反馈 → 可供性修正 → 重新执行;标注每个环节的典型失败模式。图注要求:图 4|可供性不是一次性预测,而是需要触觉闭环修正的持续过程。
五、落地建议
- 1.优先采用关键点/作用轴表示而非稠密图。 在工业场景中,可解释性与数据效率比表达力更重要;关键点表示能直接对接约束型规划器,且人工复核成本低。
- 2.为每个可供性标注绑定任务指令。 这是避免数据集病态定义的最小改动,成本几乎为零,却决定了数据能否真正使用。
- 3.采集时保留手部与接触区域的高分辨率视图。 腕部相机或近距离视角对可供性学习的价值远高于远距离全景,因为接触细节在其中可辨。
- 4.纳入失败接触样本并标注失败模式。 打滑、挤压变形、接触点偏移等失败模式是可供性模型最稀缺的监督信号。
- 5.把可供性标注与力/触觉通道对齐。 若数据同时包含力矩或触觉,应保证时间基准统一,使"视觉预测的接触点"与"实际接触力"可配对分析。
- 6.用指向标注做低成本扩容。 对大规模人类视频数据,先用点标注建立可供性弱监督,再在小规模真机数据上精调,是当前性价比最高的路径。
六、对拓比科技的可执行启示
- •硬件侧:可供性学习的关键信息集中在手—物接触区。采集设备的相机布局应考虑"手部与接触区始终处于至少一个相机的高分辨率视野内",这比单纯增加相机数量更有价值。双目在接触区提供深度与尺度的能力,是可供性从"图像位置"走向"三维接触点"的必要条件。
- •数据侧:建立任务绑定的可供性标注体系:任务指令 + 接触点/作用轴 + 成败标签 + 失败模式。这套标注体系一旦建立,就同时服务于可供性模型、VLA 训练与记忆检索,是可复用的长期资产。
- •生态侧:把可供性标注的导出格式开放(如关键点坐标 + 作用轴 + 任务指令的 JSON schema),让客户可直接对接自己的规划器。数据供应商的竞争力不在"有多少小时",而在"有多少小时是结构化到可直接训练的"。
配图位置 5(全文末尾)|图像内容:数据资产金字塔:底部"原始视频(价值低)"→ 中部"位姿/标定配套(价值中)"→ 上部"任务绑定的可供性标注(价值高)"→ 顶部"可供性 + 力/触觉对齐标注(价值最高)"。图注要求:图 5|数据价值的阶梯:结构化的深度决定单位小时的价值密度。
来源与时间
可供性概念的心理学起源(Gibson,生态心理学);自监督抓取大规模尝试(Google 抓取实验,数万次量级,2016—2017 系);基于视觉语言模型的开放词汇可供性与从人类视频定位接触点的研究(2024—2026);ICLR 2026 周期的空间接地工作(Spatial Forcing、From Spatial to Actions、PixelVLA)与 Embodied-R1(SIMPLEREnv 56.2%;8 项 XArm 任务 87.5%,相对基线 +62%;Embodied-Points-200K 数据集)。
标注:上表中的成熟度分级为主观评估;对"标注成本量级""退化速度"的描述为工程经验推断,缺乏统一量化实验支撑;部分 2026 年工作尚在预印本阶段,数据以作者公布为准。