中文

VLA-0:零修改构建最先进的视觉语言动作模型

机器人学 2025-10-16 v1 人工智能

摘要

视觉语言动作模型(Vision-Language-Action models,VLAs)为通用机器人操作具有巨大的潜力。然而,构建这些模型的最佳方式仍是一个开放问题。当前方法常常增加复杂性,例如修改视觉语言模型(VLM)的词汇表以添加动作 token,或引入特殊的动作头。值得注意的是,最简单的将动作直接表示为文本的策略至今鲜有探索。本工作引入 VLA-0 来研究这一想法。我们发现 VLA-0不仅有效,而且意想不到的强大。通过合适的设计,VLA-0超越了更为复杂的模型。在 LIBERO,这一评估 VLAs 的流行基准上,VLA-0超越了所有在相同机器人数据上训练的现有方法,包括 π0.5\pi_0.5-KI、OpenVLA-OFT 和 SmolVLA。此外,在没有大规模机器人专用训练的情况下,VLA-0还超越了在大规模机器人数据上训练的方法,如 π0.5\pi_0.5-KI、π0\pi_0、GR00T-N1 和 MolmoAct。这些发现也在实际应用中得到验证,VLA-0 在实际应用中超越了 SmolVLA,这一 VLAs 模型是在大规模真实数据上预训练的。本文总结了这些意想不到的发现,并阐述了解锁此简单而高效 VLA 设计所需的具体技术。提供了视觉结果、代码和训练好的模型:https://vla0.github.io/。

关键词

引用

@article{arxiv.2510.13054,
  title  = {VLA-0: Building State-of-the-Art VLAs with Zero Modification},
  author = {Ankit Goyal and Hugo Hadfield and Xuning Yang and Valts Blukis and Fabio Ramos},
  journal= {arXiv preprint arXiv:2510.13054},
  year   = {2025}
}