中文

重构动作以解释深度强化学习

人工智能 2021-02-16 v3 机器学习

摘要

特征归因一直是利用深度神经网络(DNN)解释监督学习中输入特征重要性的基础模块,但在应用于深度强化学习(RL)时面临新的挑战。我们提出一种通过定义一类模仿深度 RL 中网络行为的“动作重构”函数来解释深度 RL 动作的新方法。该方法使我们能够回答比直接应用 DNN 归因方法更为复杂的可解释性问题,我们将这些方法适配到构建动作重构中的“行为级归因”。它还使我们能够定义“一致性(agreement)”,一种定量评估我们方法可解释性的度量。我们在多种 Atari 游戏上的实验表明,基于扰动的归因方法在重构动作以解释深度 RL 智能体方面显著优于其他归因方法,并且比现有利用注意力的可解释性工作表现出更高的一致性。我们进一步展示动作重构使我们能够演示深度智能体如何学习玩 Pac-Man 游戏。

关键词

引用

@article{arxiv.2009.08507,
  title  = {Reconstructing Actions To Explain Deep Reinforcement Learning},
  author = {Xuan Chen and Zifan Wang and Yucai Fan and Bonan Jin and Piotr Mardziel and Carlee Joe-Wong and Anupam Datta},
  journal= {arXiv preprint arXiv:2009.08507},
  year   = {2021}
}