中文

智能体场景策略:统一空间、语义与可供性以实现机器人动作

机器人学 2025-09-25 v1 计算机视觉与模式识别

摘要

执行开放式的自然语言查询是机器人学中的一个核心问题。虽然模仿学习和视觉-语言-动作模型 (VLA) 的最新进展已经实现了有前景的端到端策略,但这些模型在面对复杂指令和新场景时仍然表现不佳。另一种方法是设计一个显式的场景表示,作为机器人与世界之间的可查询接口,利用查询结果来指导下层的运动规划。在这项工作中,我们提出了智能体场景策略 (ASP),这是一个智能体框架,它利用现代场景表示的高级语义、空间和基于可供性的查询能力,来实现一个强大的语言条件机器人策略。ASP 可以通过在更复杂技能的情况下显式推理对象可供性,以零样本的方式执行开放词汇查询。通过广泛的实验,我们将 ASP 与 VLA 在桌面操作问题上进行了比较,并展示了 ASP 如何通过可供性引导的导航和扩展的场景表示来处理房间级别的查询。(项目页面:https://montrealrobotics.ca/agentic-scene-policies.github.io/)

关键词

引用

@article{arxiv.2509.19571,
  title  = {Agentic Scene Policies: Unifying Space, Semantics, and Affordances for Robot Action},
  author = {Sacha Morin and Kumaraditya Gupta and Mahtab Sandhu and Charlie Gauthier and Francesco Argenziano and Kirsty Ellis and Liam Paull},
  journal= {arXiv preprint arXiv:2509.19571},
  year   = {2025}
}

备注

Project page: https://montrealrobotics.ca/agentic-scene-policies.github.io/