中文

基于图的符号动作表示用于VLA策略的长期规划

机器人学 2025-11-07 v1 计算机视觉与模式识别

摘要

部署能够从演示中学习新技能的自主机器人是现代机器人学的重要挑战。现有解决方案常采用基于视觉语言动作(VLA)模型的端到端仿照学习,或采用动作模型学习(AML)的符号方法。在一方面,当前VLA模型受限于缺乏高级符号规划能力,这限制了其在长期任务中的能力。另一方面,AML中的符号方法缺乏泛化和可扩展性。在本文中,我们提出了一种新型神经符号方法GraSP-VLA,该框架使用连续场景图(Continuous Scene Graph)表示来生成人类演示的符号表示。该表示用于在推理期间生成新的规划领域,作为低层VLA策略的协调器,从而扩展可连续执行的动作数量。我们的结果表明,GraSP-VLA在自动从观察中生成规划域的任务上有效地建模了符号表示。此外,实验结果表明,连续场景图表示在长期任务中协调低层VLA策略方面具有潜力。

关键词

引用

@article{arxiv.2511.04357,
  title  = {GraSP-VLA: Graph-based Symbolic Action Representation for Long-Horizon Planning with VLA Policies},
  author = {Maëlic Neau and Zoe Falomir and Paulo E. Santos and Anne-Gwenn Bosser and Cédric Buche},
  journal= {arXiv preprint arXiv:2511.04357},
  year   = {2025}
}