中文

基于符号世界模型的双层策略学习用于长时域规划

人工智能 2026-05-20 v2 机器人学

摘要

我们致力于解决构建能够可靠求解长时域规划问题的具身AI智能体这一挑战。从演示中进行的模仿学习已证明能有效训练机器人完成各种复杂任务,这些任务需要在低层连续环境中进行精细的运动控制与操作。然而,仅靠模仿学习生成长时域规划仍然是一项困难的工作。相比之下,高层的符号抽象有助于实现高效且可解释的长时域规划。我们提出结合低层模仿学习在操作与控制方面的优势,以及高层符号抽象在长时域规划方面的优势。我们通过形式为 (πhl,πll)(\pi^{\mathrm{hl}}, \pi^{\mathrm{ll}}) 的“双层策略”来实现这一思想,该策略由一个从低层演示中学习到的神经策略 πll\pi^{\mathrm{ll}} 和一个高层符号策略 πhl\pi^{\mathrm{hl}} 组成,后者由低层演示的符号抽象结合归纳泛化构建而成。我们在 BISON 系统中实现了这些思想。在扩展的 MetaWorld 基准上的实验表明,BISON 能够泛化到比 VLA 和端到端方法所解决的任务具有更长时域和更多物体数量的问题,并且在训练和推理中具有更高的时间和内存效率。值得注意的是,在忽略低层执行的情况下,BISON 的高层策略能在不到一分钟内解决包含 10,000 个相关物体的高层问题。项目页面:https://dillonzchen.github.io/bison

关键词

引用

@article{arxiv.2605.15975,
  title  = {Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning},
  author = {Dillon Z. Chen and Till Hofmann and Toryn Q. Klassen and Sheila A. McIlraith},
  journal= {arXiv preprint arXiv:2605.15975},
  year   = {2026}
}