深度强化学习中基于不确定性的分布外分类
机器学习
2020-04-17 v1 人工智能
机器学习
摘要
对分布外(OOD)数据的鲁棒性是构建可靠机器学习系统的重要目标。尤其在自主系统中,对 OOD 输入的错误预测会引发安全关键状况。作为迈向解决方案的第一步,我们考虑在基于价值的深度强化学习(RL)设置中检测此类数据的问题。我们将该问题建模为一类分类问题,提出了一种基于不确定性的 OOD 分类框架:UBOOD。其基于如下效应:智能体在训练期间遇到的情况(分布内)的认知不确定性会降低,从而低于未遇到情况(OOD)下的认知不确定性。该框架对用于估计认知不确定性的方法保持不可知,因此可与不同不确定性估计方法(例如近似贝叶斯推断方法或集成技术)组合。我们进一步提出了一种基于训练数据不确定性分布计算动态分类阈值的首个可行方案。评估表明,当与基于集成的估计器结合时,该框架产生可靠分类结果,而与基于 concrete dropout 的估计器结合时无法可靠检测 OOD 情况。总之,UBOOD 通过利用智能体价值函数的认知不确定性,为深度 RL 设置中的 OOD 分类提供了一种可行方法。
引用
@article{arxiv.2001.00496,
title = {Uncertainty-Based Out-of-Distribution Classification in Deep Reinforcement Learning},
author = {Andreas Sedlmeier and Thomas Gabor and Thomy Phan and Lenz Belzner and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2001.00496},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:1901.02219