中文

VLANeXt:构建强型视觉-语言-动作模型的配方

计算机视觉与模式识别 2026-05-21 v2 人工智能 机器人学

摘要

跟随大型基础模型的崛起,视觉-语言-动作模型(VLA)应运而生,利用视觉-语言模型中的强大视觉与语言理解能力,实现通用目的的策略学习。然而,当前的VLA生态仍然十分碎片化和探索性。尽管许多团队提出了各自的VLA模型,但在训练协议和评估设置方面的不一致,使得难以确定哪些设计选择 truly 重要。为将其在不断演变的空间中建立结构,本文在统一框架和评估设置下重新审视VLA的设计空间。我们从一个类似RT-2的简单VLA基线开始(VLA的起源),系统性地剖析沿着三个维度的设计选择:基础组件、感知要素以及动作建模视角。通过这一研究,我们提炼出12项关键发现,共同构成构建强型VLA模型的实用配方。本次探索的结果是一个简单而有效的模型,VLANeXt。它在LIBERO和LIBERO-plus基准测试中超越了最先进的方法,并在实际实验中展现出强大的性能。我们发布了一个统一且易于使用的代码库,以复现我们的发现,探索设计空间,并在共享基础上开发新的VLA变体。代码库可在 https://github.com/DravenALG/VLANeXt 查看。

关键词

引用

@article{arxiv.2602.18532,
  title  = {VLANeXt: Recipes for Building Strong VLA Models},
  author = {Xiao-Ming Wu and Bin Fan and Kang Liao and Jian-Jian Jiang and Runze Yang and Yihang Luo and Zhonghua Wu and Wei-Shi Zheng and Chen Change Loy},
  journal= {arXiv preprint arXiv:2602.18532},
  year   = {2026}
}

备注

Accepted in ICML 2026, Project Page: https://dravenalg.github.io/VLANeXt/