RL-RRT:通过从强化学习策略中学习可达性估计器进行运动动力学运动规划
机器人学
2019-07-15 v2 人工智能
机器学习
摘要
本文解决基于采样的运动动力学运动规划面临的两个挑战:识别用于局部转移的优良候选状态的方法,以及随后在这些候选状态间计算上难以处理的转向问题。通过结合基于采样的规划、快速扩展随机树(RRT)以及通过机器学习实现的高效运动动力学运动规划器,我们提出了一种针对运动动力学运动规划的长程高效规划方案。首先,我们使用深度强化学习来学习一个避障策略,将机器人传感器观测映射为动作,该策略在规划时用作局部规划器,在执行时用作控制器。其次,我们以有监督方式训练一个可达性估计器,用于预测在存在障碍物时 RL 策略到达某一状态的时间。最后,我们提出 RL-RRT,其使用 RL 策略作为局部规划器,并使用可达性估计器作为距离函数以将树生长偏向有前景的区域。我们在三个运动动力学系统上评估了我们的方法,包括物理机器人实验。三个被测机器人的结果均表明,RL-RRT 在效率上优于最先进的 kinodynamic 规划器,并且相比无转向函数的方法提供了更短的路径完成时间。所学的局部规划器策略及配套的可达性估计器展示出对先前未见实验环境的迁移能力,使得 RL-RRT 速度很快,因为昂贵的计算被简单的神经网络推理所取代。视频:https://youtu.be/dDMVMTOI8KY
引用
@article{arxiv.1907.04799,
title = {RL-RRT: Kinodynamic Motion Planning via Learning Reachability Estimators from RL Policies},
author = {Hao-Tien Lewis Chiang and Jasmine Hsu and Marek Fiser and Lydia Tapia and Aleksandra Faust},
journal= {arXiv preprint arXiv:1907.04799},
year = {2019}
}
备注
Accepted to Robotics and Automation Letters in June 2019