SLAP:面向抽象规划的捷径学习
机器人学
2026-03-03 v2 机器学习
摘要
具有稀疏奖励和连续状态与动作的长时域决策仍是人工智能和机器人领域的一个基本挑战。任务与运动规划(TAMP)是一种基于模型的框架,通过使用抽象动作(选项)进行分层规划来应对这一挑战。这些选项是手动定义的,限制了智能体只能执行我们作为人类工程师知道如何编程的行为(拾取、放置、移动)。在这项工作中,我们提出了面向抽象规划的捷径学习(SLAP),一种利用现有TAMP选项自动发现新选项的方法。我们的关键思想是使用无模型强化学习(RL)来学习由TAMP中现有选项诱导的抽象规划图中的捷径。在没有任何额外假设或输入的情况下,捷径学习比纯规划产生更短的解,并且比扁平RL和分层RL获得更高的任务成功率。定性上,SLAP发现了与手动定义的选项显著不同的动态物理即兴动作(例如,拍打、摆动、擦拭)。在四个模拟机器人环境的实验中,我们展示了SLAP能够解决并泛化到广泛的任务,将总体规划长度减少超过50%,并且始终优于规划和RL基线。
引用
@article{arxiv.2511.01107,
title = {SLAP: Shortcut Learning for Abstract Planning},
author = {Y. Isabel Liu and Bowen Li and Benjamin Eysenbach and Tom Silver},
journal= {arXiv preprint arXiv:2511.01107},
year = {2026}
}
备注
Published at the International Conference on Learning Representations (ICLR) 2026. Code available at https://github.com/isabelliu0/SLAP