E0:通过 Tweedie 离散扩散提升 VLA 模型的泛化性与细粒度控制
机器人学
2026-03-26 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉语言动作(VLA)模型提供了一种统一的机器人操作框架,通过整合视觉感知、语言理解和控制生成来实现。然而,现有的 VLA 系统仍在跨越多样化任务、场景和相机视角时难以泛化,常产生粗糙或不稳定的动作。我们认为,这些局限性与 VLA 环境中动作的结构属性密切相关,包括动作分布的内在多峰性、预训练 VLM/VLA 主干网络基于 token 的符号推理,以及现实机器人控制所施加的有效有限分辨率。针对这些属性,我们引入 E0,一种基于 Tweedie 离散扩散的框架,将动作生成表述为对量化动作 token 的迭代去噪。通过在离散动作空间中进行原则化扩散过程,E0 自然地与基于 token 的推理相吻合,支持细粒度且可执行的动作控制,避免了基于掩码的离散扩散的分布不匹配问题。我们进一步引入了球形视点扰动数据增强,以提升对相机位移的鲁棒性。实验在 LIBERO、VLABench、ManiSkill 以及真实世界 Franka 机械臂上进行,证明 E0 在 14 个多样化环境中实现了最先进的性能,平均超过强基准 10.7%。
引用
@article{arxiv.2511.21542,
title = {E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion},
author = {Zhihao Zhan and Jiaying Zhou and Likui Zhang and Qinhan Lv and Hao Liu and Jusheng Zhang and Weizheng Li and Ziliang Chen and Tianshui Chen and Ruifeng Zhai and Keze Wang and Liang Lin and Guangrun Wang},
journal= {arXiv preprint arXiv:2511.21542},
year = {2026}
}