基于强化学习中迭代奖励预测的自动驾驶车辆轨迹规划
机器人学
2024-05-14 v4
摘要
传统的自动驾驶车辆轨迹规划方法存在若干局限性。例如,启发式和显式的简单规则限制了泛化能力并阻碍复杂运动。这些局限性可以通过基于强化学习的轨迹规划来解决。然而,强化学习存在学习不稳定的问题,且现有的基于强化学习的轨迹规划方法未考虑不确定性。因此,本文提出了一种基于强化学习的自动驾驶车辆轨迹规划方法。所提出的方法涉及一种迭代奖励预测方法,该方法迭代地预测未来状态的期望。然后利用这些预测状态来预测奖励,并将其整合到学习过程中以增强稳定性。此外,还提出了一种利用不确定性传播使强化学习智能体感知不确定性的方法。所提出的方法使用CARLA模拟器进行评估。与基线方法相比,所提出的方法将碰撞率降低了60.17%,并将平均奖励提高了30.82倍。所提出方法的视频可在https://www.youtube.com/watch?v=PfDbaeLfcN4获取。
引用
@article{arxiv.2404.12079,
title = {Trajectory Planning for Autonomous Vehicle Using Iterative Reward Prediction in Reinforcement Learning},
author = {Hyunwoo Park},
journal= {arXiv preprint arXiv:2404.12079},
year = {2024}
}
备注
8 pages, 6 figures