中文

基于演员-评论家深度强化学习中利用注意力机制的可视化解释

机器学习 2021-03-09 v1

摘要

深度强化学习(DRL)在游戏和机器人控制等复杂环境中获取最优动作方面具有巨大潜力。然而,难以分析智能体的决策过程,即其选择通过学习所得动作的原因。在本工作中,我们提出 Mask-Attention A3C(Mask A3C),将注意力机制引入异步优势演员-评论家(A3C)这一基于演员-评论家的 DRL 方法中,并能够分析 DRL 中智能体的决策。A3C 由从图像提取特征的特征提取器、输出策略的策略分支以及输出状态价值的价值分支组成。在该方法中,我们聚焦于策略和价值分支,并将注意力机制引入其中。该注意力机制利用 mask-attention 对每个分支的特征图进行掩码处理,以热力图形式表达针对策略与状态价值的判断依据。我们将 Atari 2600 上游戏的 mask-attention 图可视化,发现可以轻松分析各种游戏任务中智能体决策背后的原因。此外,实验结果表明,通过引入注意力机制,智能体能够取得更高的性能。

关键词

引用

@article{arxiv.2103.04067,
  title  = {Visual Explanation using Attention Mechanism in Actor-Critic-based Deep Reinforcement Learning},
  author = {Hidenori Itaya and Tsubasa Hirakawa and Takayoshi Yamashita and Hironobu Fujiyoshi and Komei Sugiura},
  journal= {arXiv preprint arXiv:2103.04067},
  year   = {2021}
}

备注

20 pages, 19 figures