利用离线强化学习优化高速公路驾驶轨迹
机器人学
2022-03-22 v1 机器学习
摘要
实现能够输出可行、平滑且高效轨迹的自动驾驶车辆是一项长期挑战。已有若干方法被考虑,大致分为两类:基于规则的方法与基于学习的方法。基于规则的方法虽能保证安全性与可行性,但在长期规划与泛化方面存在不足。基于学习的方法能够考虑长期规划及对未知情形的泛化,但可能无法实现基于规则方法所确保的平滑性、安全性与可行性。因此,将两类方法结合显然是朝着从二者中获得最佳折衷方向迈进的一步。我们提出一种基于强化学习的方法,其学习用于高速公路全自动驾驶的目标轨迹参数。训练后的智能体输出连续轨迹参数,并据此生成并执行基于多项式的可行轨迹。我们将我们的智能体与其他四种高速公路驾驶智能体进行性能比较。实验在 Sumo 仿真器中开展,考虑了各种真实的、动态变化的高速公路场景,包括具有不同驾驶行为的周围车辆。我们证明,我们的离线训练智能体利用随机收集的数据,学会了平滑驾驶,达到尽可能接近期望速度的车速,同时优于其他智能体。代码、训练数据与细节见:https://nrgit.informatik.uni-freiburg. de/branka.mirchevska/offline-rl-tp。
引用
@article{arxiv.2203.10949,
title = {Optimizing Trajectories for Highway Driving with Offline Reinforcement Learning},
author = {Branka Mirchevska and Moritz Werling and Joschka Boedecker},
journal= {arXiv preprint arXiv:2203.10949},
year = {2022}
}