中文

NS-VLA:面向神经符号视觉语言-动作模型

机器人学 2026-03-11 v1

摘要

视觉语言-动作(VLA)模型旨在将指令在视觉上下文中进行 grounding 并生成机器人操纵的动作序列。尽管近期取得了进展,但 VLA 模型仍面临在学习相关且可重用的原语、减少对大规模数据的依赖以及简化复杂架构、实现 demonstrations 之外的探索等挑战。为此,我们提出一种新型神经符号视觉语言-动作(NS-VLA)框架,通过在线强化学习(RL)。它引入符号编码器来嵌入视觉和语言特征并提取结构化原语,使用符号求解器实现数据高效动作序列,利用在线 RL 来通过广泛探索优化生成。在机器人操纵基准测试上进行的实验表明,NS-VLA 在单次训练和数据扰动设置下均优于先前方法,同时展现出卓越的零样本通用性、高数据效率和扩大的探索空间。我们的代码已公开。

关键词

引用

@article{arxiv.2603.09542,
  title  = {NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models},
  author = {Ziyue Zhu and Shangyang Wu and Shuai Zhao and Zhiqiu Zhao and Shengjie Li and Yi Wang and Fang Li and Haoran Luo},
  journal= {arXiv preprint arXiv:2603.09542},
  year   = {2026}
}