利用元强化学习使快速学习自动驾驶车辆将其驾驶礼仪适应于变化的交通文化
机器学习
2021-04-20 v1 系统与控制
系统与控制
摘要
在现场的自动驾驶车辆必须能够在广泛的交通文化与驾驶条件下,以恰当的驾驶礼仪(即安全高效地驾驶,且不烦扰或危及他车道路使用者)执行任意车道变换。尽管深度强化学习方法近年来表现出色并被应用于自动驾驶车辆驾驶策略,但对其快速适应具有新环境动态的未知交通的能力仍存在担忧。我们将此挑战表述为多马尔可夫决策过程(MDPs)适应问题,并开发了元强化学习(MRL)驾驶策略以展示其快速学习能力。我们设计并在仿真中实现了两类环境分布变化,以验证所得 MRL 驾驶策略的快速适应能力,其显著优于基线 RL。
引用
@article{arxiv.2104.08876,
title = {Quick Learner Automated Vehicle Adapting its Roadmanship to Varying Traffic Cultures with Meta Reinforcement Learning},
author = {Songan Zhang and Lu Wen and Huei Peng and H. Eric Tseng},
journal= {arXiv preprint arXiv:2104.08876},
year = {2021}
}