中文

VQ-VLA:通过扩张向量量化动作标记器来提升视觉-语言-动作模型

机器人学 2025-07-02 v1 计算机视觉与模式识别

摘要

本文我们引入一种基于最大规模动作轨迹数据集构建的创新向量量化动作标记器,利用了比以前方法超过100倍的数据。这个广泛的数据集使我们的标记器能够捕捉丰富的时空动态, resulting in 一个不仅加速推理,还生成更平滑且连贯动作输出的模型。一旦训练,标记器可以无缝适配从短期反应行为到长期规划等各种下游任务。我们工作的关键发现之一是,合成与真实动作轨迹之间的领域差距微小,使我们能够在训练时有效利用大量合成数据而不会损害真实世界性能。为验证我们的方案,我们在模拟环境和真实机器人平台上进行了广泛实验。结果表明,随着合成轨迹数据量的增加,我们的标记器在下游任务上的性能显著提高——最 notable的是,在长期场景中实现了两个真实任务成功率提高最高可达30%。这些发现凸显了我们的动作标记器作为稳健且可扩展的解决方案的潜力,为在多样化应用领域实现更高效和更可靠的机器人控制铺平了道路。项目网站: https://xiaoxiao0406.github.io/vqvla.github.io

关键词

引用

@article{arxiv.2507.01016,
  title  = {VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers},
  author = {Yating Wang and Haoyi Zhu and Mingyu Liu and Jiange Yang and Hao-Shu Fang and Tong He},
  journal= {arXiv preprint arXiv:2507.01016},
  year   = {2025}
}

备注

Accepted by ICCV 2025