DIAL: 通过潜在世界建模解耦意图与动作以实现端到端 VLA
机器人学
2026-04-29 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉-语言-动作(VLA)模型的发展因预训练视觉语言模型(VLM)而显著加速。然而,大多数现有的端到端 VLA 将 VLM 主要用作多模态编码器,直接将视觉语言特征映射到低层动作。这一范式低估了 VLM 在高层决策中的潜力,并引入了训练不稳定性,经常损害其丰富的语义表示。为解决这些限制,我们提出了 DIAL,一个通过可微分的潜在意图瓶颈连接高层决策与低层运动执行的框架。具体而言,基于 VLM 的 System-2 通过在 VLM 的原生特征空间内合成潜在视觉前瞻来进行潜在世界建模;这种前瞻明确编码意图并作为结构瓶颈。一个轻量级的 System-1 策略随后将预测的意图与当前观测一起通过潜在逆动力学解码为精确的机器人动作。为确保优化稳定性,我们采用两阶段训练范式:一个解耦预热阶段,其中 System-2 学习预测潜在未来,而 System-1 在统一特征空间内学习在真实未来引导下的运动控制,随后进行无缝的端到端联合优化。这使得动作感知梯度能够以受控方式优化 VLM 主干网络,保留预训练知识。在 RoboCasa GR1 Tabletop 基准上的广泛实验表明,DIAL 建立了新的最先进水平,以比先前方法少 10 倍的演示数量实现了优越性能。此外,通过利用异构人类演示,DIAL 学习了物理基础的操控先验,并在人形机器人真实部署中展现出对未见物体和新颖配置的鲁棒零样本泛化能力。
引用
@article{arxiv.2603.29844,
title = {DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA},
author = {Yi Chen and Yuying Ge and Hui Zhou and Mingyu Ding and Yixiao Ge and Xihui Liu},
journal= {arXiv preprint arXiv:2603.29844},
year = {2026}
}
备注
Project page: https://xpeng-robotics.github.io/dial