中文

用于机器人导航的规划与强化学习层次结构

机器人学 2021-11-08 v2 机器学习

摘要

通过强化学习(RL)解决机器人导航任务具有挑战性,因其具有稀疏奖励和长决策视野的特性。然而,在许多导航任务中,高层(HL)任务表示(如粗略的楼层平面图)是可用的。已有工作通过由 HL 表示中的路径规划及利用规划导出的子目标来引导源任务中 RL 策略的层次化方法展示了高效学习。但这些方法通常在规划时忽略了机器人复杂的动力学及次优的子目标到达能力。本工作提出一种新颖的层次化框架以克服这些局限,该框架利用可训练的规划策略处理 HL 表示。从而可利用收集到的 rollout 数据学习机器人能力与环境条件。我们具体引入了一种基于值迭代与学习到的转移模型(VI-RL)的规划策略。在模拟机器人导航任务中,VI-RL 相较原始 RL 取得了一致显著的改进,在单一布局上与原始层次化 RL 相当但更适用于多种布局,除具有困难非完整动力学的泊车任务外与可训练 HL 路径规划基线相当,而在该泊车任务中表现出明显改进。

关键词

引用

@article{arxiv.2109.11178,
  title  = {Hierarchies of Planning and Reinforcement Learning for Robot Navigation},
  author = {Jan Wöhlke and Felix Schmitt and Herke van Hoof},
  journal= {arXiv preprint arXiv:2109.11178},
  year   = {2021}
}

备注

7 pages, 5 figures, 2021 IEEE International Conference on Robotics and Automation (ICRA), v2: DOI number added