使用 SILVER 结合 RL 指导标记解释深层强化学习中的策略:面向高维多动作环境的模型级方法
机器学习
2025-10-27 v2
摘要
深度强化学习 (RL) 取得了显著的性能,但缺乏可解释性,限制了对策略行为的信任。现有的 SILVER 框架(Li、Siddique 和 Cao 2025)通过基于 Shapley 的回归解释 RL 策略,但仅限于低维二元动作领域。我们提出将 RL 指导标记集成到 SILVER 中的增强版,将其扩展到多动作和高维环境,纳入 RL 策略自身的动作输出用于边界点识别。我们的方法首先从图像观测中提取紧凑特征表示,执行基于 SHAP 的特征归因,然后采用 RL 指导标记生成行为一致的边界数据集。随后训练替代模型,如决策树和回归函数,以解释 RL 策略的决策结构。我们在两个 Atari 环境上使用三个深度 RL 算法进行评估,并进行人类主观研究以评估所得可解释策略的清晰度和可信度。结果表明,该方法在保持竞争性能的同时,显著提高了透明度和对代理行为的人类理解程度。该工作推动了可解释 RL 的发展,将 SILVER 转化为可扩展且具有行为意识的框架,用于解释高维、多动作环境中深层 RL 代理的策略。
引用
@article{arxiv.2510.19244,
title = {Interpret Policies in Deep Reinforcement Learning using SILVER with RL-Guided Labeling: A Model-level Approach to High-dimensional and Multi-action Environments},
author = {Yiyu Qian and Su Nguyen and Chao Chen and Qinyue Zhou and Liyuan Zhao},
journal= {arXiv preprint arXiv:2510.19244},
year = {2025}
}