面向强化学习的局部解释
机器学习
2022-11-29 v2 人工智能
摘要
可解释人工智能领域的许多工作集中于解释黑盒分类模型。以领域用户能够理解的方式解释深度强化学习(RL)策略所受关注则要少得多。本文提出一种基于从自动学习的元状态中识别重要状态来理解 RL 策略的新视角。我们的方法与以往许多方法的关键概念差异在于:我们依据由专家策略动态性所支配的局部性来形成元状态,而非基于动作的相似性,并且我们不假设对状态空间底层拓扑有任何特定先验知识。理论上,我们证明寻找元状态的算法收敛,且从每个元状态中选择重要状态的目标是子模的,从而可实现高效的高质量贪心选择。在四个领域(four rooms、door-key、minipacman 和 pong)上的实验以及一项精心设计的用户研究表明,我们的视角有助于更好地理解策略。我们推测,这是因为我们的元状态更直观:相应的重要状态是可处理的中间目标的强指示符,更易于人类解释和遵循。
引用
@article{arxiv.2202.03597,
title = {Local Explanations for Reinforcement Learning},
author = {Ronny Luss and Amit Dhurandhar and Miao Liu},
journal= {arXiv preprint arXiv:2202.03597},
year = {2022}
}
备注
Accepted to AAAI 2023