基于深度逆强化学习的 MPC 时空代价地图推断
机器人学
2022-01-19 v1 人工智能
摘要
自主生成令其他交通参与者感到自然的驾驶行为可能是困难的。通过逆强化学习(IRL),我们可以从人类示范中学习底层奖励函数,从而实现该过程的自动化。我们提出一种新的 IRL 算法,学习一个目标条件的时空奖励函数。所得代价地图由模型预测控制器(MPC)用于执行任务,而无需对任何代价函数进行手工设计或手工调参。我们在 CARLA 模拟器中将提出的 Goal-conditioned SpatioTemporal Zeroing Maximum Entropy Deep IRL (GSTZ)-MEDIRL 框架与 MPC 结合,用于自动驾驶、车道保持和变道任务,场景为具有挑战性的密集交通高速公路。与其他基线方法(包括行为克隆、最先进的 RL 策略以及带有基于学习的行为预测模型的 MPC)相比,我们提出的方法显示出更高的成功率。
引用
@article{arxiv.2201.06539,
title = {Spatiotemporal Costmap Inference for MPC via Deep Inverse Reinforcement Learning},
author = {Keuntaek Lee and David Isele and Evangelos A. Theodorou and Sangjae Bae},
journal= {arXiv preprint arXiv:2201.06539},
year = {2022}
}
备注
IEEE Robotics and Automation Letters (RA-L)