中文

解耦强化学习中的认知不确定性与偶然不确定性

机器学习 2022-06-06 v1

摘要

刻画预测奖励上的偶然不确定性与认知不确定性有助于构建可靠的强化学习(RL)系统。偶然不确定性源于不可约的环境随机性,导致固有的高风险状态与动作。认知不确定性源于学习过程中积累的有限信息,不足以做出明智决策。刻画偶然与认知不确定性可用于加速训练环境中的学习、改进对相似测试环境的泛化,并在异常测试环境中标记不熟悉的行为。本工作中,我们引入一个解耦 RL 中偶然与认知不确定性的框架。(1) 我们首先定义四个需求性质,刻画 RL 在训练与测试时对偶然与认知不确定性估计的期望行为。(2) 接着我们提出四个受监督学习启发的 RL 模型(即蒙特卡洛 dropout、集成、深度核学习模型和证据网络)来实例化偶然与认知不确定性。最后,(3) 我们提出一种基于分布外环境检测与扰动环境泛化的实用评估方法,以评估无模型 RL 中的不确定性估计。我们给出理论与实验证据,验证精心为无模型 RL 智能体配备监督学习不确定性方法可满足我们的需求性质。

关键词

引用

@article{arxiv.2206.01558,
  title  = {Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning},
  author = {Bertrand Charpentier and Ransalu Senanayake and Mykel Kochenderfer and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2206.01558},
  year   = {2022}
}