基于Shapley 值的强化学习解释理论框架
机器学习
2025-08-01 v2
摘要
强化学习代理在复杂决策任务中可实现超人表现,但其行为往往难以理解和解释。这种缺乏解释性限制了在需要理解和信任的安全关键场景中的部署。我们识别了三个核心解释目标,这些目标共同提供了对强化学习代理的全面理解:行为、结果和预测。我们通过利用代理在其环境中观察到的 individual features 的影响,发展了一个统一的理论框架来解释这三个元素。我们通过使用 Shapley 值来推导 features 的影响,这些值整体且唯一地满足一组 well-motivated 的公理,以确保公平且一致的信用分配。提出的方法称为 Shapley 值解释强化学习 (SVERL),提供了一个统一的理论框架,用于全面且有意义地解释强化学习代理。它产生的解释具有精确语义,不仅可解释,而且在数学上是有根据的,使我们能够识别和纠正先前解释中的概念性问题。通过示例,我们展示了 SVERL 如何产生有用、直观的 agent 行为、结果和预测的解释,这些解释单凭观察 agent 行为是无法察觉的。
引用
@article{arxiv.2505.07797,
title = {A Theoretical Framework for Explaining Reinforcement Learning with Shapley Values},
author = {Daniel Beechey and Thomas M. S. Smith and Özgür Şimşek},
journal= {arXiv preprint arXiv:2505.07797},
year = {2025}
}