中文

基于规划算子的分层强化学习

机器人学 2024-07-01 v2

摘要

堆叠等长时序操作任务长期构成机器人操作领域的挑战,尤其在使用强化学习(RL)方法时,其常难以学习实现这些复杂目标的正确动作序列。为学习该序列,符号规划方法基于高层推理提供了良好方案,然而规划器常难以满足精确执行所需的底层控制特异性。本文引入一种新颖框架,通过高层算子与底层策略的协作将符号规划与分层RL相集成。我们的贡献将规划算子(例如先决条件与效果)作为基于Scheduled Auxiliary Control(SAC-X)方法的层次化RL算法的一部分进行集成。我们开发了双用途高层算子,既可用于整体规划,也可作为独立、可复用的策略。我们的方法为长时序任务(例如堆叠立方体)提供了灵活方案。实验结果显示,我们提出的方法在学习与执行整个堆叠序列上获得平均97.2%成功率,且学习独立策略(例如reach(98.9%)、lift(99.7%)、stack(85%)等)的成功率亦如此。采用我们所提方法时训练时间亦减少68%。

关键词

引用

@article{arxiv.2309.14237,
  title  = {Hierarchical Reinforcement Learning Based on Planning Operators},
  author = {Jing Zhang and Emmanuel Dean and Karinne Ramirez-Amaro},
  journal= {arXiv preprint arXiv:2309.14237},
  year   = {2024}
}