导语
如果说 2023–2024 年的具身智能论文在回答"能不能做",那么 2025 年末至 2026 年中的顶会论文在回答"能不能稳定地、便宜地、跨本体地做"。NeurIPS 2025 的具身智能板块已出现明确的工程化分类——加速与部署(Accelerating and Deploying)与触觉(Tactile)被单列为类别;ICLR 2026 的接收列表里,VLA 相关工作的重心集中在记忆检索、token 剪枝、量化、跨本体适配与统一扩散。这条线索的意义在于:当一个领域开始大量产出"如何让已有方案更快更小更通用"的论文时,它的基础范式通常已经稳定,竞争转入工程与数据。
技术要点
NeurIPS 2025:世界模型与数据并重。 该届具身方向的主要板块包括 VLA 模型、数据、世界模型、规划与推理、导航、人形、三维视觉、策略、加速与部署、触觉、灵巧操作、基准与数据集。代表性工作包括:DreamVLA(用综合世界知识"做梦"的 VLA 模型)、PEVA(LeCun 团队,以条件扩散 Transformer 从全身物理动作预测第一视角视频)、BEAST(面向动作序列的高效 B 样条词元化)。"加速与部署"被单列,说明边缘推理已成为独立研究方向。
ICLR 2026:VLA 的效率与记忆竞赛。 据开源论文汇总(更新于 2026-03),ICLR 2026 的 VLA 类别工作密度极高,可归纳为五条主线:
- 1.记忆与检索:MemoryVLA、Scaling up Memory for Robotic Control via Experience Retrieval——直指长程任务短板。
- 2.效率压缩:SP-VLA(模型调度 + token 剪枝联合优化)、AutoQVLA(通道级差异化的量化)、Action-aware Dynamic Pruning(按动作相关性动态剪枝)。
- 3.跨本体与统一:X-VLA(软提示 Transformer 作为跨本体接口)、Unified Vision-Language-Action Model、Unified Diffusion VLA(离散扩散与自回归统一)、MetaVLA(统一元协同训练)。
- 4.表征 grounding:Spatial Forcing(隐式空间表征对齐)、From Spatial to Actions(以空间基础先验为 VLA 奠基)、PixelVLA(像素级理解)。
- 5.具身推理与指向:Embodied-R1 以"指向(pointing)"作为与本体无关的中间表征,构建 Embodied-Points-200K 数据集,用两阶段强化微调(RFT)训练 3B VLM,在 11 个具身空间与指向基准上达到最优;在 SIMPLEREnv 上零样本成功率 56.2%、在 8 项真实 XArm 任务上 87.5%,无需任务特定微调,较基线提升 62%。
一个值得注意的方法论转向:VLM4VLA 等工作开始系统反思"换骨干到底有多大用"。这类元研究通常出现在技术范式稳定期,对工程选型的指导价值高于新架构论文。
关键突破
- •"指向"被提出为跨本体的中间表征:Embodied-R1 的思路把高层视觉语言理解与底层动作原语之间插入一个与本体无关的中间层,为跨本体泛化提供了不同于"统一动作空间"的新解法。
- •记忆从隐性能力变为显式模块:多篇工作把记忆独立出来做检索与扩展,与 RoboDojo 榜单中"记忆"维度的巨大分差(47.74 vs 13.37)相互印证。
- •端侧部署进入论文主流:量化、剪枝、调度三类工作同时出现,且都给出了针对性的通道/词元重要性判据,而非通用压缩。
- •世界模型开始进入 VLA 主干讨论:Genie Envisioner 等把世界基础平台与操作统一,为 WAM 路线提供学术支撑。
对产业的影响
第一,数据供应商需要理解客户的效率约束。若客户部署的是量化剪枝后的小模型,训练数据的分布与标注粒度就应当匹配其容量——例如减少冗余帧、提高关键状态的覆盖密度,而非简单堆量。
第二,"中间表征"路线的兴起,提高了对结构化标注的需求。指向、可供性、空间关系一类的中间层标注,可能比稠密动作标签更易跨本体复用,也更易于自动化生成。
第三,加速与部署成为独立方向,意味着评测指标需要扩展。除成功率外,应补充延迟、功耗、显存占用与降级鲁棒性,这些指标反过来对数据的分辨率、帧率与视角数提出明确约束。
配图建议
图 1(放置:导语之后)
- •画面描述:NeurIPS 2025 与 ICLR 2026 具身方向的关键词云/主题分布对比图。左半为 NeurIPS 2025(世界模型、数据、部署、触觉权重较大),右半为 ICLR 2026(VLA 效率、记忆、跨本体权重较大),中间用箭头标注从"能力探索"到"工程收敛"的转移。
- •图注:图 1|两届顶会的主题重心变化:从能力探索转向效率、记忆与跨本体(基于公开论文列表的归纳,属整理性判断)。
图 2(放置:"技术要点"中 ICLR 五条主线之后)
- •画面描述:五条主线的分支图,从中心"ICLR 2026 VLA"出发分出五支:记忆与检索 / 效率压缩 / 跨本体与统一 / 表征 grounding / 具身推理与指向。每支末端挂 2–3 个代表工作名称与一句话要点。
- •图注:图 2|ICLR 2026 VLA 方向五条主线及代表工作(依据公开论文汇总,2026-03)。
图 3(放置:"关键突破"第一条之后)
- •画面描述:Embodied-R1 的"指向即中间表征"示意。上层为自然语言指令,中层为四个具身指向能力(如指向目标物体、指向放置位置、指向可抓取区域、指向轨迹关键点),下层为不同本体的动作原语。中间层用高亮横条强调"与本体无关"。
- •图注:图 3|以"指向"作为跨本体中间表征:在语义理解与动作执行之间插入可迁移层。
来源与时间
- •Embodied-AI-Paper-TopConf 开源论文汇总(更新至 ICLR 2026,2026-03),涵盖 NeurIPS 2025、CoRL 2025、ICLR 2026 等分类列表。
- •Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation(ICLR 2026,OpenReview 编号 10007997;SIMPLEREnv 56.2%、8 项 XArm 任务 87.5%、较基线 +62%)。
- •DreamVLA(NeurIPS 2025);PEVA(NeurIPS 2025,LeCun 团队);BEAST(NeurIPS 2025)。
- •Genie Envisioner、Spatial Forcing、From Spatial to Actions(ICLR 2026)。
标注说明:论文所属会议与分类以公开汇总列表为依据,个别论文可能同时投递或转投其他会议,最终版本与指标以会议官方与 arXiv 最新版为准(待核实)。"工程化转向"为本文基于主题分布的趋势判断,属推测性结论。