SAFE-RL:深度强化学习策略的显著性感知反事实解释器
机器学习
2024-04-30 v1 人工智能
摘要
尽管深度强化学习(Deep Reinforcement Learning, DRL)在复杂控制任务中显示出前景,但其所学策略的可解释性不足阻碍了其在安全关键应用(如自动驾驶系统, ADS)中的采纳。反事实(Counterfactual, CF)解释最近因其能够解释黑箱深度学习(Deep Learning, DL)模型而获得了关注。CF示例与输入的最小变化相关联,以DL模型的互补输出为结果。寻找此类变更,特别是针对高维视觉输入,面临重大挑战。此外,DRL代理动作依赖于过去状态观察序列的时序依赖性进一步复杂化了CF示例的生成。为此,我们提出使用显著性图(saliency map)识别DRL代理过去观察状态序列中最具影响力的输入像素。随后,我们将该图输入深度生成模型,以实现在显著性区域附近受约束的修改下生成合理的CF。我们在 diverse 领域中评估了该框架的有效性,包括ADS、Atari Pong、Pacman和space-invaders游戏,使用传统的性能指标如有效性、接近度和稀疏性。实验结果表明,该框架生成的CF在广泛的环境和DRL代理中比现有方法更具信息性和合理性。为促进该领域的研究,我们已在 https://github.com/Amir-Samadi/SAFE-RL 上公开数据集和代码。
引用
@article{arxiv.2404.18326,
title = {SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies},
author = {Amir Samadi and Konstantinos Koufos and Kurt Debattista and Mehrdad Dianati},
journal= {arXiv preprint arXiv:2404.18326},
year = {2024}
}