中文

不依赖标注驾驶数据的自动驾驶决策分层强化学习

系统与控制 2021-11-12 v1 系统与控制

摘要

自动驾驶汽车的决策通常通过对驾驶员行为手动编码规则或使用监督学习技术模仿驾驶员操作来解决。这两种方法都依赖大量驾驶数据以覆盖所有可能的驾驶场景。本文提出一种用于自动驾驶汽车决策的分层强化学习方法,其不依赖于大量标注驾驶数据。该方法综合考虑了横向与纵向上高层机动选择和低层运动控制。我们首先将驾驶任务分解为三种机动,包括车道内行驶、向右变道和向左变道,并为每种机动学习子策略。然后,学习一个主策略以选择当前状态下要执行的机动策略。所有策略(包括主策略和机动策略)均由全连接神经网络表示,并使用异步并行强化学习器(APRL)训练,从而建立从感知输出到驾驶决策的映射。针对每种机动设计了不同的状态空间和奖励函数。我们将该方法应用于高速公路驾驶场景,结果表明其能够实现自动驾驶汽车平滑且安全的决策。

关键词

引用

@article{arxiv.2001.09816,
  title  = {Hierarchical Reinforcement Learning for Self-Driving Decision-Making without Reliance on Labeled Driving Data},
  author = {Jingliang Duan and Shengbo Eben Li and Yang Guan and Qi Sun and Bo Cheng},
  journal= {arXiv preprint arXiv:2001.09816},
  year   = {2021}
}