返回新闻与洞察
前沿观察

VLA 的"内卷年":从大一统架构到工程可用的效率竞赛

VLA 的"内卷年":从大一统架构到工程可用的效率竞赛

2026-09-08
拓比科技首席新闻官
前沿观察
拓比科技数据采集与标注基地实景

导语

2026 年,视觉-语言-动作(VLA)模型已无争议地成为具身智能的主流架构,但竞争的重心发生了微妙转移:领跑者不再比拼"能不能做",而是比拼"能不能实时做、能不能便宜地做、能不能换本体不用重训"。ICLR 2026 的 VLA 论文列表里,出现了大量关于 token 剪枝、量化、跨本体软提示、记忆检索与统一扩散的工作——这是一个技术进入工程化阶段的典型信号。当架构红利被摊平,效率与泛化成为新的分水岭,而这恰恰是对数据质量要求最高的阶段。

技术要点

架构层面:大一统已确立,分歧在细节。 主流方案仍是"预训练 VLM + 动作专家",但 2026 年出现若干重要变体:

  • 统一扩散与自回归:ICLR 2026 的 Unified Diffusion VLA 等工作尝试把离散扩散与自回归统一进同一目标,兼顾多模态动作分布建模与推理速度;FASTer 提出可学习动作词元化器与分块解码,提升自回归路线的效率。
  • 跨本体泛化:X-VLA 以软提示 Transformer 作为可扩展的跨本体接口,试图用一套权重适配多种机器人;MetaVLA 用统一元协同训练提升适配效率。
  • 记忆与检索:MemoryVLA 把"感知—认知"记忆引入 VLA,Scaling up Memory for Robotic Control via Experience Retrieval 则通过经验检索扩展记忆容量,直指长程任务短板。
  • 效率工程:SP-VLA 联合进行模型调度与 token 剪枝,AutoQVLA 指出 VLA 量化中"并非所有通道等价",Action-aware Dynamic Pruning 按动作相关性动态剪枝——这三条共同说明端侧部署已经是明确的工程目标

评测层面的反思开始出现。 VLM4VLA 系统重新审视了不同 VLM 骨干对 VLA 性能的影响;"Actions as Language"探讨了在不灾难性遗忘的前提下把 VLM 微调为 VLA 的路径。这类"回头看"的工作通常出现在技术范式趋于稳定之后。

工程化落地加速。 小米开源 Xiaomi-robotics-0(arXiv 2026),主打实时执行;NVIDIA 与社区推出 VLA Foundry 作为统一训练框架;π0.7(Physical Intelligence,2026-04)强调可控性与涌现能力,并把世界模型作为子目标图像生成器集成。

关键突破

  • 效率不再是附属指标:SP-VLA、AutoQVLA、Action-aware Dynamic Pruning 三项同期工作同时指向"推理预算",说明业界已公认 VLA 的瓶颈从"效果"转向"延迟 × 效果"。
  • 跨本体从愿景变为可训练目标:X-VLA 的软提示方案、MetaVLA 的元协同训练,把"一套权重适配多本体"从口号变成可优化的目标函数。这对数据侧影响深远——跨本体能力越强,异构数据的聚合价值越高。
  • 记忆被显式建模:RoboDojo 榜单显示"记忆"是区分头部模型的关键维度(2026-08-25 更新后,登顶模型在记忆维度得分 47.74,第二名仅 13.37),与 ICLR 2026 记忆类论文的大量出现相互印证。

对产业的影响

第一,数据质量的重要性被架构进步放大而非削弱。当模型侧通过剪枝、量化、检索把"有效信息密度"推到极致时,输入数据的信噪比就直接决定了输出质量。多相机的时间同步误差、标定漂移、模糊帧,过去只是"轻微降质",现在会直接转化为策略失败。

第二,跨本体泛化能力的提升,会提高"多构型数据"的溢价。能够覆盖多种本体、多种任务、含失败与纠正样本的数据集,其边际价值高于单一构型的等量数据。

第三,端侧部署趋势提高了对"数据—模型协同设计"的要求。若客户的目标模型是剪枝量化后的小模型,那么训练数据的分布就应当匹配该模型的容量——数据供应商需要理解客户的部署形态,而不只是交付原始视频。

配图建议

图 1(放置:导语之后)

  • 画面描述:VLA 架构演进横轴图,从左到右依次排列四代形态:① VLM + 简单动作头(2023–2024)→ ② VLM + 动作专家/流匹配(2025)→ ③ + 记忆检索与世界模型子目标(2026 上半年)→ ④ + token 剪枝/量化/跨本体软提示(2026 下半年)。每代下方标注代表工作名称与会议。
  • 图注:图 1|VLA 架构的四阶段演进:从"能输出动作"到"实时、跨本体、可部署"。

图 2(放置:"技术要点"中效率工程段落后)

  • 画面描述:三栏对照的效率优化手段示意。左栏"Token 层":整张特征图上被点亮的 patch 逐层减少,标注 Pruning / Merging;中栏"参数层":权重矩阵分块,部分块标为低比特(INT4/INT8),标注 Mixed-precision Quantization;右栏"调度层":早退出的推理路径示意,标注 Model Scheduling。底部横条对比"优化前延迟"与"优化后延迟"。
  • 图注:图 2|VLA 的三类效率优化路径:token 剪枝、混合精度量化与模型调度(延迟对比为示意值)。

图 3(放置:"对产业的影响"第一条之后)

  • 画面描述:一条从"数据质量"到"策略成功率"的传导链:同步误差 / 标定漂移 / 运动模糊 → 几何监督信号带噪 → 表征质量下降 → 剪枝量化后信息损失放大 → 策略失败率上升。每个环节用箭头连接,噪声注入环节用红色标注。
  • 图注:图 3|数据质量如何经由模型效率优化被放大:端侧压缩会放大输入噪声的影响。

来源与时间

  • ICLR 2026 VLA 相关论文列表(MemoryVLA、PixelVLA、X-VLA、SP-VLA、AutoQVLA、Unified Diffusion VLA、FASTer、WholeBodyVLA 等):开源论文汇总仓库 Embodied-AI-Paper-TopConf,更新于 2026-03。
  • π0.7 "a Steerable Model with Emergent Capabilities":Physical Intelligence,2026-04。
  • Xiaomi-robotics-0、VLA Foundry、Being-H0.5/H0.7、Fast-WAM:arXiv 2026,经 NVIDIA 技术博客《Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models》整理引用(2026)。
  • RoboDojo 榜单记忆维度 47.74 vs 13.37:RoboDojo 榜单更新,2026-08-25。

标注说明:ICLR 2026 论文以会议接收列表为准,个别论文的最终版本与指标可能与预印本存在差异(待核实)。架构分代方式为本文基于公开时间线的归纳,属推测性整理,非官方划分。