中文

PokeVLA:以全面世界知识引导赋能袖珍视觉-语言-动作模型

机器人学 2026-04-27 v2

摘要

视觉-语言-动作(VLA)模型的最新进展为机器人操作开辟了新途径,但现有方法效率有限,且缺乏高层级知识与空间感知能力。为应对这些挑战,我们提出 PokeVLA,一个轻量而强大的具身操作基础模型,能有效地将视觉-语言理解注入动作学习。我们的框架引入两阶段训练范式:首先,我们在一个包含 240 万样本、涵盖空间定位、可供性及具身推理任务的精选多模态数据集上预训练一个紧凑的视觉-语言模型(PokeVLM);其次,通过多视角目标感知语义学习、几何对齐以及一个新颖的动作专家模块,将与操作相关的表征注入动作空间。大量实验表明,在 LIBERO-Plus 基准测试和真实世界部署中,PokeVLA 均展现出最先进的性能,在多种扰动下的成功率和鲁棒性均优于可比的基线方法。为促进可复现性和社区进步,我们将开源代码、模型权重以及用于构建预训练数据集的脚本。项目页面:https://getterupper.github.io/PokeVLA

关键词

引用

@article{arxiv.2604.20834,
  title  = {PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance},
  author = {Yupeng Zheng and Xiang Li and Songen Gu and Yuhang Zheng and Shuai Tian and Weize Li and Linbo Wang and Senyu Fei and Pengfei Li and Yinfeng Gao and Zebin Xing and Yilun Chen and Qichao Zhang and Haoran Li and Wenchao Ding},
  journal= {arXiv preprint arXiv:2604.20834},
  year   = {2026}
}