深度强化学习中分布外检测基准
机器学习
2021-12-07 v1
摘要
基于强化学习(RL)的解决方案正被应用于包括机器人、医疗保健和工业自动化在内的多种领域。大多数研究关注这些解决方案在表现良好时的情况,但其在遇到分布外输入时会失效。RL策略与大多数机器学习模型存在相同缺陷。RL的分布外检测在文献中通常未被充分覆盖,且缺乏针对该任务的基准。本工作中,我们提出一个在强化学习设定下评估OOD检测方法的基准,通过对非视觉标准环境的物理参数进行修改或对视觉环境的状态观测进行破坏来生成OOD数据。我们讨论了生成可产生OOD数据的自定义RL环境的方法,并评估了三种用于OOD检测任务的不确定性方法。我们的结果表明,集成方法具有最佳的OOD检测性能,且在多个环境中具有较低的标准差。
引用
@article{arxiv.2112.02694,
title = {Benchmark for Out-of-Distribution Detection in Deep Reinforcement Learning},
author = {Aaqib Parvez Mohammed and Matias Valdenegro-Toro},
journal= {arXiv preprint arXiv:2112.02694},
year = {2021}
}
备注
9 pages, 5 figures, 5 tables, Bayesian Deep Learning Workshop @ NeurIPS 2021