用于分布外分类的策略熵
机器学习
2020-05-26 v1 人工智能
机器学习
摘要
强化学习系统部署于现实世界的一个关键前提是能够可靠检测智能体未经训练的情形。当错误预测导致执行有害动作时,此类情形可能引发潜在安全风险。本工作中,我们提出 PEOC,一种基于策略熵的分布外分类器,可可靠检测深度强化学习中未遇到的状态。它利用智能体策略的熵作为单类分类器的分类分数。我们使用程序化环境生成器评估了该方法。结果表明,在所评估环境中,PEOC 相较于最先进的单类分类算法极具竞争力。此外,我们提出了一种用于基准测试强化学习中分布外分类的结构化流程。
引用
@article{arxiv.2005.12069,
title = {Policy Entropy for Out-of-Distribution Classification},
author = {Andreas Sedlmeier and Robert Müller and Steffen Illium and Claudia Linnhoff-Popien},
journal= {arXiv preprint arXiv:2005.12069},
year = {2020}
}