VLA-0:零修改构建最先进的视觉语言动作模型
机器人学
2025-10-16 v1 人工智能
摘要
视觉语言动作模型(Vision-Language-Action models,VLAs)为通用机器人操作具有巨大的潜力。然而,构建这些模型的最佳方式仍是一个开放问题。当前方法常常增加复杂性,例如修改视觉语言模型(VLM)的词汇表以添加动作 token,或引入特殊的动作头。值得注意的是,最简单的将动作直接表示为文本的策略至今鲜有探索。本工作引入 VLA-0 来研究这一想法。我们发现 VLA-0不仅有效,而且意想不到的强大。通过合适的设计,VLA-0超越了更为复杂的模型。在 LIBERO,这一评估 VLAs 的流行基准上,VLA-0超越了所有在相同机器人数据上训练的现有方法,包括 -KI、OpenVLA-OFT 和 SmolVLA。此外,在没有大规模机器人专用训练的情况下,VLA-0还超越了在大规模机器人数据上训练的方法,如 -KI、、GR00T-N1 和 MolmoAct。这些发现也在实际应用中得到验证,VLA-0 在实际应用中超越了 SmolVLA,这一 VLAs 模型是在大规模真实数据上预训练的。本文总结了这些意想不到的发现,并阐述了解锁此简单而高效 VLA 设计所需的具体技术。提供了视觉结果、代码和训练好的模型:https://vla0.github.io/。
引用
@article{arxiv.2510.13054,
title = {VLA-0: Building State-of-the-Art VLAs with Zero Modification},
author = {Ankit Goyal and Hugo Hadfield and Xuning Yang and Valts Blukis and Fabio Ramos},
journal= {arXiv preprint arXiv:2510.13054},
year = {2025}
}