基于扰动的显著性图解释 Atari 智能体的基准评测
机器学习
2022-02-03 v3 人工智能
神经与进化计算
摘要
解释深度强化学习(DRL)智能体行为最突出的方法之一是生成显著性图,显示每个像素对智能体决策的贡献程度。然而,目前尚无工作专门对 DRL 智能体不同显著性图方法的保真度进行计算评估与比较。由于 DRL 智能体的决策属于总体策略的一部分,对其显著性图进行计算评估尤为困难。例如,基于值的 DRL 算法的输出神经元同时编码当前状态的值以及在该状态下执行各动作的值。在评估此类智能体的显著性图时,应考虑这种歧义性。本文中,我们比较了五种流行的基于扰动的方法,以对训练于四种不同 Atari 2600 游戏的 DRL 智能体生成显著性图。这些方法的比较采用两个计算指标:对智能体学习参数的依赖性(健全性检查)与对智能体推理的保真度(输入退化)。在健全性检查中,我们遇到一种方法的问题并提出了修复这些问题的方案。对于保真度,我们确定了影响在特定情境下应选择何种显著性方法的两个主要因素。
引用
@article{arxiv.2101.07312,
title = {Benchmarking Perturbation-based Saliency Maps for Explaining Atari Agents},
author = {Tobias Huber and Benedikt Limmer and Elisabeth André},
journal= {arXiv preprint arXiv:2101.07312},
year = {2022}
}