摘要
视觉—语言—动作模型(Vision-Language-Action, VLA)在过去两年里从实验室原型走到了产业分水岭。它把预训练的视觉语言模型(VLM)改造成能直接输出机器人动作序列的策略网络,理论上继承了互联网规模的语义先验,从而具备跨任务、跨物体的零样本泛化能力。但 2025—2026 年的真实进展并非线性:一方面,跨本体(cross-embodiment)训练、记忆与检索、动作 token 化、推理效率四条技术主线都有可验证的突破;另一方面,"大模型越大越好"的朴素叙事在真机评测中被反复证伪——参数规模与成功率之间并不存在稳定单调关系,数据配比、动作表示与控制频率的影响往往更大。本文按"问题背景—核心技术路径—代表工作对比—挑战与趋势—落地建议"的框架梳理 VLA 的现状,并给出对具身数据供应商的可执行启示。
配图位置 1(摘要之后)|图像内容:VLA 的三段式结构示意图:左侧多相机/本体感受输入,中部 VLM 骨干 + 动作头,右侧动作序列输出;用箭头标注"语义先验流入"与"动作频率约束"两条相互制衡的通路。图注要求:图 1|VLA 的核心张力:语义能力来自大模型,实时性受制于控制频率。
一、问题背景:VLA 解决的到底是什么问题
传统机器人操作策略的范式是"任务专用":为某一个任务(如"把红色杯子放进抽屉")收集几百到几千条遥操作轨迹,用行为克隆(Behavior Cloning, BC)训练一个小网络。这条路径的缺陷在工业落地中暴露无遗:每新增一个物体或一条指令就要重新采集,边际成本不随规模下降;策略对初始位姿、光照、背景极其敏感,换一个工位就要重训;语言指令只能做简单的模板匹配,无法处理"把那个看起来能装水的东西拿过来"这类需要常识推理的表述。
VLA 的提出正是为了打破这个循环。它的核心假设是:互联网规模的图文预训练已经编码了大量关于物体功能、空间关系与任务分解的常识,只要把动作空间"翻译"成语言模型能消费的 token 序列,就能把这些先验迁移到机器人控制上。RT-2(2023)首次系统验证了这一假设,此后 OpenVLA、π0、GR00T、Being-H0 等工作沿着不同技术路线推进。
但工程界很快发现三个硬约束。第一是频率错配:VLM 骨干单次前向通常在 100—500 ms 量级,而力控与柔顺操作需要 50—200 Hz 的闭环,两者差了两个数量级。第二是动作表示的离散化损失:把连续动作量化成 256 或 1024 个 bin 会引入不可忽略的量化误差,在精密插入、旋拧等任务上直接体现为成功率断崖。第三是数据异构性:不同本体的关节数、自由度、动力学参数、相机位姿完全不同,把它们混在一起训练,既可能获得跨本体泛化,也可能互相干扰(negative transfer)。
配图位置 2(第一节末尾)|图像内容:三段对比柱状/折线图,横轴为"任务专用 BC / 单本体 VLA / 跨本体 VLA",纵轴为"新增任务的边际数据采集量",曲线随泛化能力上升而下降,同时叠加一条"单任务峰值成功率"曲线呈相反趋势。图注要求:图 2|泛化能力与单任务峰值性能的权衡:为泛化支付的税。
二、核心技术路径
2.1 动作 token 化:离散、连续与扩散的三条路线
第一代 VLA 普遍采用离散 token 化:把每维动作均匀量化为 256 个 bin,直接复用语言模型的交叉熵损失。这条路线的优势是训练稳定、可直接继承 VLM 权重,缺点是量化误差与推理时逐 token 自回归的速度瓶颈。
第二条路线是流匹配/扩散动作头(flow matching / diffusion action head),代表工作是 π0 与 π0.5(Physical Intelligence)。它保留 VLM 骨干做语义编码,但用一个独立的、参数量小得多的动作专家(action expert)通过流匹配生成连续动作块(action chunk)。这样既避免了量化损失,又能一次输出未来 H 步动作,把有效控制频率提升一个量级。π0.7(2026 年 4 月公布)在此基础上强化了长程任务的分解能力。
第三条路线是快速 tokenizer,代表工作是 FAST(Frequency-space Action Sequence Tokenization)及其加速版 FASTer。它把动作序列变换到频域再做离散压缩,token 数可下降一个数量级,从而显著降低自回归步数。FASTer 公开报告了相对基线的明显加速。
2.2 跨本体:把"本体身份"变成条件而非障碍
跨本体训练的核心难点是:动作空间的物理含义随本体而变。2026 年的主流解法有三类。其一是软提示(soft prompt),代表工作 X-VLA:为每种本体学习一组连续提示向量,作为可训练前缀注入骨干,让同一套权重在不同本体上呈现不同的行为模式。其二是元学习式适配,代表工作 MetaVLA:把本体差异建模为隐变量,通过少量目标本体数据推断该隐变量后再执行。其三是统一动作空间归一化:把所有本体映射到标准化的末端位姿空间(而非关节空间),从而绕过自由度差异——这条路线在桌面操作上效果好,但在人形全身控制上会丢失关节约束信息。
2.3 记忆与检索:把"训练时没见过的任务"变成"检索时找得到的经验"
纯参数化的 VLA 把知识压进权重,导致遇到新任务时只能依赖微弱的外推。2026 年的一条活跃路线是外部记忆增强,代表工作包括 MemoryVLA 与 Experience Retrieval。它们在推理时从经验库中检索与当前观测最相似的轨迹片段,作为上下文或条件注入策略。这条路线对数据供应商的意义极大:它把"数据"从一次性训练耗材变成了可长期复用的在线资产,数据的价值不再随训练结束而折旧。
2.4 效率:让 VLA 跑在真实算力预算上
产业落地绕不开推理成本。2026 年的代表性工作包括 SP-VLA(结构化剪枝)、AutoQVLA(自动量化)与 Action-aware Dynamic Pruning(动作感知的动态剪枝)。一个值得注意的工程洞察是:动作 token 的重要性在时间上高度不均——动作块开头的 token 决定整体轨迹走向,末尾的 token 更多是插值,因此可以对不同位置施加不同计算量。
配图位置 3(第二节末尾)|图像内容:四象限矩阵,横轴"参数效率←→性能上限",纵轴"推理延迟低←→高",把 离散 token VLA / 流匹配 VLA / 记忆增强 VLA / 剪枝量化 VLA 四个簇标在相应位置。图注要求:图 3|VLA 技术路线的效率—性能坐标系,不存在支配性解。
三、代表工作对比
| 工作 | 动作表示 | 骨干/规模 | 关键主张 | 已公开指标 | 时间 |
|---|---|---|---|---|---|
| RT-2 | 离散 token | PaLI-X / PaLM-E | 互联网语义先验迁移 | 新物体泛化显著优于 BC | 2023 |
| OpenVLA | 离散 token | 7B 开源 | 开源可复现基线 | 成为社区默认基线 | 2024 |
| π0 / π0.5 | 流匹配动作专家 | VLM + 小动作专家 | 连续动作 + 动作块 | 长程折叠/清理任务领先 | 2025 |
| π0.7 | 流匹配 + 长程分解 | — | 长时程任务分解 | 官方称长程任务显著提升 | 2026-04 |
| FAST / FASTer | 频域 token 压缩 | 依附于 VLM | token 数降一个量级 | 推理步数显著下降 | 2025 / 2026 |
| X-VLA | 软提示跨本体 | — | 本体身份作为条件 | 跨本体迁移优于单本体 | ICLR 2026 投稿周期 |
| MetaVLA | 隐变量元学习 | — | 少量数据推断本体 | 少样本适配收益 | 2026 |
| MemoryVLA | 外部记忆检索 | VLM + 检索库 | 非参数化经验复用 | 新任务成功率提升 | 2026 |
| Embodied-R1 | 指向(pointing)作为中间表示 | — | 先指后动,解耦感知与动作 | SIMPLEREnv 56.2%;8 项 XArm 任务 87.5%,相对基线 +62% | 2026 |
注:跨工作的绝对数值不可直接比较,评测环境、任务集与协议差异巨大;上表仅用于定位技术路线,不构成排名。
四、挑战与趋势
挑战一:真机评测的方差远大于论文报告。 同一策略在同一任务上,不同初始位姿、不同操作员的遥操作演示、甚至不同时间段的光照,都会带来两位数的成功率波动。这意味着"提升 3 个百分点"在多数真机设置下不具统计显著性。
挑战二:数据配比的作用被系统性低估。 多个公开复现研究指出,在混合数据集上训练时,加入大量低质量或分布不匹配的轨迹(尤其是来自不同本体、不同控制频率的旧数据)会显著拉低目标本体上的表现。如何做数据课程(data curriculum)与质量加权,是比换骨干更高杠杆的问题。
挑战三:语言指令与真实需求的错位。 工业客户真正需要的往往是"把这一批次中不合格的挑出来",这是一个带有判定标准与例外处理的长尾需求,而不是"拿苹果"这类原子指令。VLA 在原子指令上的能力已相对成熟,在带判定标准的可变任务上仍不可靠。
趋势一:空间接地的强化。 2026 年出现了一组以"先指后动"为核心的工作(Spatial Forcing、From Spatial to Actions、PixelVLA、Embodied-R1),把视觉定位作为显式中间步骤,既提升可解释性,也让策略对背景变化的鲁棒性更强。
趋势二:效率与部署成为主战场。 随着模型能力趋于可用,竞争焦点从"能不能做"转向"用多少算力做"。
趋势三:数据资产的在线化。 记忆与检索路线一旦成为标配,数据的价值形态将从"训练语料"转为"运行时知识库",这会重塑定价与交付模式。
配图位置 4(第四节末尾)|图像内容:时间轴图,2023—2026 标注四个阶段的竞争焦点迁移:能力验证 → 规模扩张 → 效率与部署 → 数据资产在线化。图注要求:图 4|VLA 竞争焦点的四年迁移,当前处于效率与数据形态的重叠期。
五、落地建议
- 1.不要以参数规模作为选型依据。 在固定的算力与数据预算下,动作表示与数据配比的收益通常超过骨干规模。建议采用固定的小规模评测集做受控消融,而非依赖公开榜单。
- 2.优先选择支持动作块输出的架构。 动作块(action chunk)是同时解决频率错配与轨迹抖动的最小改动,改造成本低而收益明确。
- 3.建立本体的"身份卡"。 为每个客户本体记录关节数、自由度、控制频率、相机位姿与标定参数,作为跨本体训练的条件输入,这一步是跨本体泛化能否成立的前提。
- 4.为记忆/检索路线提前准备数据结构。 轨迹应按"任务—场景—物体—失败模式"四维打标,并保留可检索的观测片段,而非只保留完整长轨迹。
- 5.把失败样本纳入训练集并显式标注。 只在成功轨迹上做行为克隆的策略,遇到分布外状态时会直接失控;失败样本与恢复行为是提升鲁棒性的高性价比数据。
- 6.评估必须包含真实工况扰动。 光照变化、背景杂物、物体位姿随机化应作为标准评测项,否则实验室数字没有迁移价值。
六、对拓比科技的可执行启示
- •硬件侧:VLA 的输入是图像序列,相机的时间同步与位姿标定直接决定跨本体训练能否收敛。µs 级硬同步、全局快门与随机附带的标定参数文件,是让客户数据"可训练"的前置条件。
- •数据侧:从"卖小时数"转向"卖结构化经验库"。为每条轨迹补充任务标签、失败标签、物体与场景元数据,并支持按片段检索,这正好对接记忆增强 VLA 的需求。
- •生态侧:公开标定格式与时间戳基准,让客户可以把拓比的数据直接喂进自己的 VLA 训练栈,而不是被锁在私有工具链中——降低切换成本比增加功能更能赢得长期客户。
配图位置 5(全文末尾)|图像内容:传导链图:µs 级同步 + 精确标定 → 数据可训练 → 跨本体 VLA 收敛 → 客户策略成功率。图注要求:图 5|数据基础设施的质量最终以 VLA 训练收敛速度与客户策略成功率的形式被感知。
来源与时间
RT-2(2023,Google DeepMind);OpenVLA(2024,开源社区基线);π0 / π0.5(Physical Intelligence,2025)与 π0.7(2026-04);FAST(2025)与 FASTer(2026);ICLR 2026 周期内关于记忆/检索(MemoryVLA、Experience Retrieval)、效率(SP-VLA、AutoQVLA、Action-aware Dynamic Pruning)、跨本体(X-VLA 软提示、MetaVLA)、空间接地(Spatial Forcing、From Spatial to Actions、PixelVLA)与具身推理(Embodied-R1,SIMPLEREnv 56.2%、8 项 XArm 任务 87.5%、相对基线 +62%)的代表工作;小米 Xiaomi-robotics-0、VLA Foundry、Being-H0.5/H0.7、Unified Diffusion VLA、WholeBodyVLA(2025—2026)。
标注:上述跨工作指标来自各自论文与官方发布,评测协议不同、不可直接比较;对"数据配比收益高于骨干规模""记忆路线将改变数据价值形态"的判断属于前瞻研判,尚无统一实验结论支撑。