中文

基于虚拟安全笼的弱监督强化学习用于自动驾驶高速公路纵向控制

机器学习 2021-03-18 v1 系统与控制 系统与控制

摘要

神经网络与强化学习在自动驾驶车辆控制中的使用已日益流行。然而,所得控制策略的不透明性构成了在自动驾驶车辆中部署基于神经网络控制的重要障碍。本文提出一种基于强化学习的自动驾驶车辆纵向控制方法,其中基于规则的安全笼为车辆提供增强的安全性,并为强化学习智能体提供弱监督。通过引导智能体到达有意义的状态与动作,该弱监督改善了训练期间的收敛性并增强了最终训练策略的安全性。该基于规则的监督控制器还具有完全可解释的进一步优势,从而能够采用传统的确认与验证方法确保车辆安全。我们比较了带与不带安全笼的模型,以及具有最优与受限模型参数的模型,表明弱监督一致地改善了探索的安全性、收敛速度及模型性能。此外,我们表明当模型参数受限或次优时,安全笼能使模型学会安全的驾驶策略,即便该模型无法仅通过强化学习训练来驾驶。

关键词

引用

@article{arxiv.2103.09726,
  title  = {Weakly Supervised Reinforcement Learning for Autonomous Highway Driving via Virtual Safety Cages},
  author = {Sampo Kuutti and Richard Bowden and Saber Fallah},
  journal= {arXiv preprint arXiv:2103.09726},
  year   = {2021}
}

备注

Published in Sensors