返回新闻与洞察
视觉算法专项

长程任务的视觉记忆:让机器人记住"刚才做了什么、东西放哪了"

当前具身智能系统在单步或短程操作(数秒、数个动作)上已取得可观进展,但在长程任务(数分钟到数十分钟、数十到数百个步骤)上成功率断崖式下跌。这一落差的根源不只是策略能力,更是记忆:机器人需要在任务执行过程中记住已经探…

2026-09-08
拓比科技视觉算法团队
视觉算法专项
TOBI E2 双目具身采集设备实物

摘要

当前具身智能系统在单步或短程操作(数秒、数个动作)上已取得可观进展,但在长程任务(数分钟到数十分钟、数十到数百个步骤)上成功率断崖式下跌。这一落差的根源不只是策略能力,更是记忆:机器人需要在任务执行过程中记住已经探索过的区域、已经操作过的物体、物体的最新位置(即使它已被移出视野)、以及已经失败过的尝试。视觉记忆(visual memory)研究的正是如何把历史视觉信息编码、存储与检索,并在需要时注入当前决策。2025—2026 年,这一方向因 VLA 的外部记忆增强、具身问答基准的出现以及长期评测平台的推动而迅速升温。本文梳理视觉记忆的表示形式、写入与检索机制、与 VLA 的融合方式、代表工作对比与评测现状,并给出面向具身数据供应商的启示。核心判断是:记忆能力是当前具身系统最确定的短板,也是最依赖数据形态的能力——它对数据的要求(长程、连续、带时序结构)与当前主流数据集(短程、独立、去时序)存在结构性错配。

配图方案

配图位置 1(摘要之后)|图像内容:成功率随任务时长衰减曲线,横轴为任务时长(秒,对数轴)或步骤数,纵轴为成功率;曲线在 30 秒附近开始快速下降,标注"短程可行区""长程崩溃区";同时叠加一条"带外部记忆的系统"曲线,衰减更缓。图注要求:图 1|长程任务的成功率悬崖:记忆缺失是主要成因之一。

一、问题背景:为什么长程任务会崩

长程任务的失败模式与短程任务截然不同。短程失败通常是执行误差(抓偏了、插入角度不对);长程失败则主要是状态遗忘与规划漂移

具体的失效表现包括:重复搜索——机器人已经打开过第一个抽屉并确认里面没有目标物,但在后续步骤中又去打开同一个抽屉;位置遗忘——机器人把钥匙放在了桌子左侧,转身后再回来却去桌子右侧寻找;错误累积——早期的微小偏差未被检测和纠正,导致后续所有步骤的前提失效;目标漂移——在长序列执行中,策略逐渐偏离原始指令的意图,去执行语义相近但错误的子任务。

从机器学习角度看,这些问题源于同一个结构缺陷:策略是马尔可夫的,而任务是非马尔可夫的。当前主流 VLA 每次推理只看最近几帧(或一个短窗口),历史信息仅通过隐状态或有限的上下文传递。当任务需要在第 200 步回忆第 5 步的观测时,信息早已丢失。

值得注意的是,这一短板在评测中被长期掩盖。主流操作基准(如 LIBERO 的 130 个任务、CALVIN 的长程任务)多数在数十秒量级,无法暴露记忆问题。近年出现的长期评测平台(如 RoboDojo,42 项仿真 + 18 项真机,5 个维度)才开始系统性地量化这一差距——2026 年 8 月的快照显示,头部系统在记忆维度上的得分(47.74)与整体平均(19.34%)相比虽相对突出,但与人类水平(76.03%)仍有数量级差距。

配图方案

配图位置 2(第一节末尾)|图像内容:四个失效模式的漫画式分镜:重复搜索、位置遗忘、错误累积、目标漂移;每个分镜上方标注发生的时间点与丢失的信息类型。图注要求:图 2|长程失败的四副面孔:背后都是同一件事——该记住的没记住。

二、核心技术路径

2.1 记忆的表示:从隐状态到显式结构化存储

隐式记忆是最简单的形式:用 RNN/LSTM/Transformer 的隐状态或 KV 缓存承载历史。优势是无需额外设计,劣势是容量有限、不可查询、不可解释,且在长序列上退化明显。

显式空间记忆是当前最成熟的路线:把历史观测融合成一个持久的场景表示(如占据栅格、语义地图、三维点云或高斯泼溅场),机器人可以随时查询"某处有什么"。这条路线的优势是与人类空间认知方式一致、可可视化、可增量更新;劣势是构建与维护成本高,且在动态场景(物体被移动)中需要额外的更新机制。

显式经验记忆(episodic memory)存储的是轨迹片段而非场景:把过去的执行片段(观测—动作—结果)存入一个可检索的库,在遇到相似情境时检索复用。代表工作包括 2026 年的 MemoryVLA 与 Experience Retrieval。这条路线与空间记忆互补:前者回答"东西在哪",后者回答"以前这种情况下我怎么做的"。

2.2 写入机制:记住什么、忘掉什么

无差别地存储所有历史会导致检索效率崩溃和噪声淹没。有效的写入策略包括:显著性触发(在状态发生重要变化时写入,如物体位置改变、任务子目标完成)、失败优先(失败尝试与其上下文优先写入,避免重蹈覆辙)、压缩摘要(把一段连续经验压缩为语义摘要,如"已检查左侧三个抽屉,均无目标物")。

一个被低估的工程点是:写入策略应与检索需求共同设计。如果检索时需要的是"某个物体最后出现的位置",那么写入时就应建立物体—位置索引,而非存储原始帧。

2.3 检索:按什么相似度找

检索的质量决定了记忆是否有用。常见检索键包括:视觉相似度(当前观测与记忆帧的嵌入距离)、语义/语言相似度(当前子任务描述与记忆片段描述的匹配)、空间邻近(当前位姿附近的记忆)、时间邻近(最近的经验)。实用系统通常组合多个键并加权。

2026 年的一个趋势是语言作为检索键:既然现代系统已有强大的语言编码器,把记忆片段配上自然语言描述,用语言做检索,既可利用语义抽象能力,又便于人检查与编辑。

2.4 与 VLA 的融合:外部记忆增强

把记忆注入 VLA 有三种位置:输入级(把检索到的记忆帧/摘要拼进上下文,作为额外 token)、中间级(通过 cross-attention 把记忆表示注入骨干中间层)、输出级(用检索到的历史轨迹调整动作分布)。输入级最简单、兼容性最好;中间级表达力最强但需要训练;输出级改动最小但受限于动作空间。

配图方案

配图位置 3(第二节末尾)|图像内容:记忆系统架构图:左侧观测流 → 写入控制器(显著性/失败优先/压缩摘要)→ 记忆库(分三格:空间地图 / 经验片段 / 语义摘要)→ 检索器(视觉+语义+空间+时间 多键加权)→ 注入 VLA(输入级/中间级/输出级 三个入口)。图注要求:图 3|视觉记忆的完整链路:写入策略与检索键的设计比记忆库容量更关键。

三、代表工作对比

工作/类别记忆形式写入策略检索键已公开指标时间
隐状态/KV 缓存隐式全量无(顺序读取)短程有效,长程退化通用基线
语义/占据地图显式空间逐帧融合空间查询导航类任务成熟经典
三维场景场(点云/高斯)显式空间增量更新空间 + 语义重建与定位指标成熟2024—2026
MemoryVLA经验片段显著性视觉 + 语义新任务成功率提升2026
Experience Retrieval经验片段多键论文报告检索增益2026
Embodied-R1 等指向类无显式记忆SIMPLEREnv 56.2%;8 项 XArm 任务 87.5%,相对基线 +62%2026
具身问答基准(EQA 类)评测侧衡量"是否记得"2023—2026
RoboDojo 记忆维度评测侧2026-08-25:头部 47.74,第二名 13.37;整体平均 19.34%;人类 76.03%2026

:跨工作指标不可直接比较;RoboDojo 数据为时间快照,随平台更新变化;部分 2026 年工作为预印本或会议投稿周期,结论以最终版本为准。

四、挑战与趋势

挑战一:评测缺失导致进展难以量化。 记忆能力的评测需要长程、多阶段、带状态变化的任务,而这类基准的构建成本远高于单步任务。这是该方向进展缓慢的制度性原因。

挑战二:数据形态与需求错配。 记忆能力需要长程连续、带时序结构、含状态变化的数据,而主流数据集是由大量独立的短程演示片段组成的(Open X-Embodiment 约 140 万条轨迹但每条都很短;DROID 76k 条、350 小时、564 场景、86 任务)。这种"短片段海洋"无法训练记忆能力。

挑战三:检索错误的代价不对称。 检索到错误的记忆比没有记忆更糟——它会给策略一个高置信度的错误前提。如何做检索的置信度校准与拒答("我不记得了,需要重新搜索"),是一个尚未被充分研究但工程上至关重要的问题。

趋势一:记忆从隐式走向显式、从不可查走向可查询。 这是确定方向,争论只在表示形式。

趋势二:记忆与规划的融合。 记忆不是终点,它需要接入任务规划:记住"已做了什么"才能规划"还要做什么"。

趋势三:长期评测平台推动该方向加速。 一旦记忆被纳入标准化评测(如 RoboDojo 的记忆维度),资源投入会快速跟进。

配图方案

配图位置 4(第四节末尾)|图像内容:错配示意图:左侧"主流数据集形态"(大量独立短片段,图标为许多小方块),右侧"记忆训练所需形态"(长程连续序列,图标为一条带分段的连续带),中间用虚线箭头标注"结构性错配"。图注要求:图 4|数据形态错配:记忆能力不是靠更多短数据能解决的。

五、落地建议

  1. 1.先建立长程任务的评测能力,再谈优化。 没有长程评测就无法判断记忆改进是否有效。建议至少构造 10—20 个 3—10 分钟、含状态变化与回溯需求的任务作为内部基准。
  2. 2.优先实现显式空间记忆。 在多数工业场景中,"物体当前在哪"是最有价值的记忆,而这条路线技术最成熟、收益最确定。
  3. 3.为记忆设计"拒答"机制。 检索置信度低于阈值时,应触发重新搜索而非强行使用低质量记忆。这是降低长程灾难性失败的高性价比措施。
  4. 4.把子目标完成状态显式化。 用一个可检查的结构记录"哪些子目标已完成、哪些物体已被操作",比依赖隐状态可靠得多,且便于人工干预。
  5. 5.数据采集必须包含完整长程过程。 采集时应记录从任务开始到结束的完整连续序列,而非把任务切碎成独立片段;同时捕获中途的失败与回溯。
  6. 6.为记忆数据补充语义摘要标注。 对每个片段配一句自然语言描述(如"打开左侧第二个抽屉,未找到目标"),成本极低但对基于语言的检索价值巨大。

六、对拓比科技的可执行启示

  • 硬件侧:长程采集对设备的续航、散热稳定性与长时间标定一致性提出硬要求。一个 5 分钟的连续采集任务,如果设备在 3 分钟后因发热导致标定漂移,整段数据的可用性就大打折扣。续航与热稳定性应作为长程数据能力的核心指标对外披露。
  • 数据侧长程连续数据是当前的稀缺品。绝大多数公开与商用数据集以短程片段为主,能支撑记忆研究的长程、连续、带状态变化的数据极为有限。把"长程连续采集能力"做成产品线(明确标注单条轨迹的时长分布、状态变化次数、是否含回溯与失败恢复),是差异化竞争的直接抓手。
  • 生态侧:推动"长程数据卡"的字段标准化——除常规字段外,增加:单条轨迹时长、子目标数量、状态变化事件数、是否含失败与恢复、是否已配语义摘要。参与定义这类标准,是把硬件与数据能力转化为行业话语权的低成本路径。
配图方案

配图位置 5(全文末尾)|图像内容:数据卡字段扩展示意:基础字段层(时长/分辨率/相机数/帧率)→ 几何字段层(标定/同步/位姿)→ 时序字段层(子目标数/状态变化/失败恢复/语义摘要);三层逐层叠加,右侧标注每层对应的下游能力(能训练什么)。图注要求:图 5|数据卡的三层结构:字段的深度决定数据能支撑的能力上限。

来源与时间

MemoryVLA 与 Experience Retrieval(2026,ICLR 2026 周期内关于记忆/检索的代表工作);Embodied-R1(SIMPLEREnv 56.2%;8 项 XArm 任务 87.5%,相对基线 +62%;Embodied-Points-200K);RoboDojo 长期评测平台(约 20 家机构,42 项仿真 + 18 项真机,5 个维度;2026 年 7 月头部 8.80% vs 人类 76.03%,真机最高 12.8% vs 100%;2026-08-25 DM0.5 综合 24.90,平均 19.34%,记忆维度 47.74 对第二名 13.37);Open X-Embodiment(约 140 万条轨迹,22 种本体、527 项技能、311 个场景);DROID(76k 条轨迹、350 小时、564 场景、86 任务、3 路立体视觉、15 Hz);LIBERO(130 个任务)、CALVIN;EgoTSR(ICML 2026,4600 万样本,长程 92.4%、感知 88.2%);具身问答(EQA)基准(2023—2026 持续演进)。

标注:跨数据集与跨工作指标不可直接比较;对"数据形态错配""记忆是当前最确定短板"的判断属于前瞻研判;RoboDojo 数据为时间快照,以平台最新公布为准。