PEARL:用于运动规划的偏好评估强化学习
机器人学
2018-12-03 v1
摘要
机器人运动规划常需寻找平衡不同用户意图或偏好的轨迹。这些偏好之一通常是到达目标,而另一个可能是避障。在此,我们将此类及类似任务形式化为加速度控制机器人上的偏好平衡任务(PBTs),并提出一种运动规划解决方案——偏好评估强化学习(PEARL)。PEARL 在受限训练域上使用强化学习,并结合由用户给定意图设计的特征。PEARL 的规划器随后在扩展域中为更复杂的问题生成轨迹。我们提出了一种对随机扰动进行 rejection 的适配方法,并提供了深入分析,包括任务完成条件以及当条件不成立时的行为分析。PEARL 在五个问题上进行评估:两个多智能体避障任务和三个在运行时随机扰动系统的任务:1)含 1000 个追捕者的多智能体追捕问题,2)穿越 900 个移动障碍物的机器人导航(其仅在含 4 个静态障碍物的环境中训练),3)空中货物运输,4)两机器人会合,5)飞行倒立摆。最后,我们在带有受随机扰动影响的悬挂载荷的物理四旋翼 UAV 机器人上评估该方法。视频 https://youtu.be/ZkFt1uY6vlw 包含了实验及仿真可视化。
引用
@article{arxiv.1811.12651,
title = {PEARL: PrEference Appraisal Reinforcement Learning for Motion Planning},
author = {Aleksandra Faust and Hao-Tien Lewis Chiang and Lydia Tapia},
journal= {arXiv preprint arXiv:1811.12651},
year = {2018}
}
备注
20 pages