重新思考强化学习的分布外检测:推进评估与检测方法
机器学习
2024-04-11 v1 人工智能
摘要
尽管强化学习(RL)算法已成功应用于众多序列决策问题,但它们对不可预见测试环境的泛化能力仍是一个重要隐患。本文研究 RL 中的分布外(OOD)检测问题,侧重于在测试阶段识别 RL 智能体在其训练环境中未曾遇到过的情况。我们首先对 RL 中 OOD 检测的术语进行了澄清,使其与其他机器学习领域的文献保持一致。随后,我们提出了新的 OOD 检测基准场景,这些场景在智能体-环境交互回路的不同组件中引入了具有时间自相关性的异常。我们论证了尽管此类场景与现实世界情况密切相关,但在现有文献中却未得到充分研究。实验结果验证了我们的理论预测,表明 SOTA 的 OOD 检测器无法识别此类异常。为解决这一问题,我们提出了一种新颖的 OOD 检测方法,称为 DEXTER(通过提取时间序列表征进行检测)。通过将环境观测视为时间序列数据,DEXTER 提取显著的时间序列特征,随后利用孤立森林算法的集成来检测异常。我们发现 DEXTER 能够在各基准场景中可靠地识别异常,与 SOTA 的 OOD 检测器以及源自统计学的高维变点检测器相比,表现出更优越的性能。
引用
@article{arxiv.2404.07099,
title = {Rethinking Out-of-Distribution Detection for Reinforcement Learning: Advancing Methods for Evaluation and Detection},
author = {Linas Nasvytis and Kai Sandbrink and Jakob Foerster and Tim Franzmeyer and Christian Schroeder de Witt},
journal= {arXiv preprint arXiv:2404.07099},
year = {2024}
}
备注
Accepted as a full paper to the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024)