中文

解释你的行动:使用特定且相关的特征归因理解智能体动作

计算机视觉与模式识别 2020-04-07 v4 人工智能

摘要

随着深度强化学习(RL)被应用于更多任务,需要可视化和理解所学智能体的行为。显著性图通过高亮输入状态中与智能体采取动作最相关的特征来解释智能体行为。现有的基于扰动的显著性计算方法通常会高亮输入中与智能体所采取动作无关的区域。我们提出的方法 SARFA(Specific and Relevant Feature Attribution,特定且相关的特征归因)通过平衡特异性和相关性这两个捕捉显著性不同期望的方面,生成更聚焦的显著性图。前者捕捉扰动对所要解释动作的相对期望奖励的影响。后者降低改变除所要解释动作之外其他动作相对期望奖励的无关特征权重。我们在训练用于下棋类游戏(国际象棋和围棋)和 Atari 游戏(Breakout、Pong 和 Space Invaders)的智能体上比较 SARFA 与现有方法。我们通过示例(国际象棋、Atari、围棋)、人类研究(国际象棋)和自动评估方法(国际象棋)表明,SARFA 生成的显著性图比现有方法更易于人类解释。代码发布和演示视频见 https://nikaashpuri.github.io/sarfa-saliency/。

关键词

引用

@article{arxiv.1912.12191,
  title  = {Explain Your Move: Understanding Agent Actions Using Specific and Relevant Feature Attribution},
  author = {Nikaash Puri and Sukriti Verma and Piyush Gupta and Dhruv Kayastha and Shripad Deshmukh and Balaji Krishnamurthy and Sameer Singh},
  journal= {arXiv preprint arXiv:1912.12191},
  year   = {2020}
}

备注

Accepted at the International Conference on Learning Representations (ICLR) 2020