中文

深度强化学习中基于不确定性的分布外检测

机器学习 2019-01-09 v1 人工智能 机器学习

摘要

我们考虑深度强化学习中的分布外(OOD)样本检测问题。在基于价值的强化学习设定下,我们提出直接在智能体的价值估计神经网络上使用不确定性估计技术来检测 OOD 样本。我们工作的重点在于分析生成不确定性估计的近似贝叶斯推断方法及相关集成技术的适用性。尽管先前工作表明基于 dropout 的变分推断技术和基于 bootstrap 的方法可用于建模认知不确定性,但其在深度强化学习中检测 OOD 样本的适用性仍是一个开放问题。我们的结果表明,不确定性估计可用于区分分布内与分布外样本。相较于基于 dropout 的方法,在整个强化学习智能体训练过程中,基于 bootstrap 的方法往往能产生更可靠的认知不确定性估计。

关键词

引用

@article{arxiv.1901.02219,
  title  = {Uncertainty-Based Out-of-Distribution Detection in Deep Reinforcement Learning},
  author = {Andreas Sedlmeier and Thomas Gabor and Thomy Phan and Lenz Belzner and Claudia Linnhoff-Popien},
  journal= {arXiv preprint arXiv:1901.02219},
  year   = {2019}
}