可解释强化学习导论:目标、方法与需求
人工智能
2025-07-18 v1 机器学习
摘要
近期人工智能 (AI) 模型的成功伴随着其内部机制的不透明性,这尤其体现在深度神经网络的使用上。为理解这些内部机制并解释 AI 模型的输出,已提出一系列方法,归属于可解释 AI (XAI) 领域。本文聚焦于 XAI 的一个子领域,即可解释强化学习 (XRL),旨在解释通过强化学习学习的智能体的行为。我们提出一种基于两个问题"What"和"How"的直观分类法。第一个问题关注方法解释的目标,而第二个问题涉及解释的提供方式。我们运用该分类法对超过 250 篇论文进行了最新综述。此外,我们呈现了一组接近 XRL 的领域,认为这些领域也应引起社区关注。最后,我们确定了 XRL 领域的一些需求。
引用
@article{arxiv.2507.12599,
title = {A Survey of Explainable Reinforcement Learning: Targets, Methods and Needs},
author = {Léo Saulières},
journal= {arXiv preprint arXiv:2507.12599},
year = {2025}
}
备注
69 pages, 19 figures