自动驾驶强化学习的不确定性辨识、估计与约束
人工智能
2023-05-15 v1 机器学习
机器人学
摘要
深度强化学习(DRL)已成为开发更智能自动驾驶车辆(AVs)的一种有前景的方法。DRL在AVs上的典型应用是训练基于神经网络的驾驶策略。然而,神经网络的黑盒性质可能导致不可预测的决策失败,使此类AVs不可靠。为此,本文提出一种方法来辨识并保护DRL驾驶策略中不可靠的决策。基本思想是估计并约束策略的性能不确定性,其量化了由于训练数据不足或网络拟合误差引起的潜在性能下降。通过约束不确定性,DRL模型的性能始终优于基线策略。由数据不足引起的不确定性通过自助法(bootstrapped method)估计。随后,由网络拟合误差引起的不确定性使用集成网络估计。最后,加入基线策略作为性能下界以避免潜在决策失败。整体框架称为不确定性约束强化学习(UBRL)。所提UBRL在不同训练数据量的DRL策略上进行了评估,以无保护左转驾驶场景为例。结果表明UBRL方法能够辨识DRL策略中潜在不可靠的决策。即便DRL策略训练不充分且不确定性高,UBRL也能保证优于基线策略。同时,UBRL的性能随训练数据增多而提升。该方法对DRL在真实道路驾驶中的应用具有价值,并提供了一种评估DRL策略的指标。
引用
@article{arxiv.2305.07487,
title = {Identify, Estimate and Bound the Uncertainty of Reinforcement Learning for Autonomous Driving},
author = {Weitao Zhou and Zhong Cao and Nanshan Deng and Kun Jiang and Diange Yang},
journal= {arXiv preprint arXiv:2305.07487},
year = {2023}
}