基于元强化学习的自动驾驶车辆换道策略
机器学习
2020-08-31 v1 机器人学
摘要
监督学习与强化学习的最新进展为将相关方法应用于自动驾驶提供了新的机遇。然而,在动态变化环境中实现自动驾驶操纵仍面临挑战。模仿学习等监督学习算法可通过在大量标注数据上训练泛化至新环境,但针对每个新环境获取充足数据往往不切实际或成本过高。尽管强化学习方法可通过试错方式训练智能体来缓解这一数据依赖问题,但在适应新环境时仍需从零开始重新训练策略。因此,本文提出一种元强化学习(MRL)方法,以提升智能体在不同交通环境(建模为不同交通拥堵等级)下执行自动换道操纵的泛化能力。具体而言,我们在轻度至中度交通密度下训练模型,并在全新的重度交通密度条件下进行测试。我们使用碰撞率与成功率来量化所提模型的安全性与有效性。我们基于预训练方法开发了一个基准模型,其采用与所提模型相同的网络结构与训练任务以进行公平比较。仿真结果表明,当泛化至重度交通密度新环境时,所提方法的整体成功率比基准模型高出至多20%,碰撞率也比基准模型降低至多18%。最后,所提模型展现出更稳定高效的适应新环境的泛化能力,仅需极少步梯度更新即可达到100%成功率与0%碰撞率。
引用
@article{arxiv.2008.12451,
title = {Meta Reinforcement Learning-Based Lane Change Strategy for Autonomous Vehicles},
author = {Fei Ye and Pin Wang and Ching-Yao Chan and Jiucai Zhang},
journal= {arXiv preprint arXiv:2008.12451},
year = {2020}
}
备注
8 pages, 6 figures