集成分位数网络:不确定性感知的强化学习及其在自动驾驶中的应用
机器人学
2023-04-18 v2 人工智能
机器学习
摘要
强化学习(RL)可用于为自动驾驶创建决策智能体。然而,以往方法仅提供黑箱解决方案,无法给出智能体对其决策置信度的信息。对智能体决策的偶然不确定性和认知不确定性进行估计,是自动驾驶实际应用的基础。因此,本文提出集成分位数网络(EQN)方法,将分布式RL与集成方法相结合,以获得完整的不确定性估计。通过对回报的分位数函数进行隐式学习来估计回报分布,从而得到偶然不确定性;而在自助采样数据上训练一组智能体,以提供认知不确定性的贝叶斯估计。同时引入了一种用于分类哪些决策具有不可接受不确定性的准则。结果表明,EQN方法在不同遮挡交叉口场景中,通过考虑估计的偶然不确定性,能够平衡风险与时间效率。此外,训练后的智能体可利用认知不确定性信息识别未训练过的情形,从而避免在学习分布之外做出无根据的、潜在危险的决策。
引用
@article{arxiv.2105.10266,
title = {Ensemble Quantile Networks: Uncertainty-Aware Reinforcement Learning with Applications in Autonomous Driving},
author = {Carl-Johan Hoel and Krister Wolff and Leo Laine},
journal= {arXiv preprint arXiv:2105.10266},
year = {2023}
}