面向自动驾驶策略学习的深度强化学习与深度模仿学习综述
机器人学
2022-01-21 v1
摘要
自动驾驶(AD)智能体基于在线感知结果生成驾驶策略,这些感知结果在多个抽象层次上获得,例如行为规划、运动规划与控制。驾驶策略对于实现安全、高效与和谐的驾驶行为至关重要,而AD智能体在复杂场景中仍面临重大挑战。由于深度强化学习(DRL)与深度模仿学习(DIL)技术在机器人与视频游戏等领域的成功应用,近年来利用这些技术推导AD策略的研究工作大量涌现。本文对这一研究体系进行了全面综述,从三个层面展开:首先,从系统视角构建了文献研究分类法,识别出将DRL/DIL模型集成到AD架构中的五种模式。其次,全面回顾了用于执行特定AD任务的DRL/DIL模型的形式化表述,涵盖了模型状态与动作空间以及强化学习奖励的多种设计。最后,深入回顾了DRL/DIL模型如何解决AD应用关于驾驶安全、与其他交通参与者交互以及环境不确定性的关键问题。据我们所知,这是首个聚焦基于DRL/DIL的AD策略学习的综述,同时从系统驱动、任务驱动与问题驱动视角加以探讨。我们分享并讨论了相关发现,这可能引导未来对多个主题的探究。
引用
@article{arxiv.2101.01993,
title = {A Survey of Deep RL and IL for Autonomous Driving Policy Learning},
author = {Zeyu Zhu and Huijing Zhao},
journal= {arXiv preprint arXiv:2101.01993},
year = {2022}
}