动作 Q-Transformer:基于动作查询的编码器-解码器模型在深度强化学习视觉解释中的应用
机器学习
2023-06-27 v1
摘要
Transformer 在有监督学习中的优异表现引发了人们对其在深度强化学习(DRL)中潜在应用的日益关注,以期在广泛问题上取得高性能。然而,DRL 智能体的决策是一个黑箱,极大阻碍了其在现实问题中的应用。为解决该问题,我们提出动作 Q-Transformer(AQT),将 Transformer 编码器-解码器结构引入基于 Q-learning 的 DRL 方法。在 AQT 中,编码器计算状态价值函数,解码器计算优势函数,以促进获取指示智能体决策的不同注意力。AQT 中的解码器利用代表各动作信息的动作查询作为查询,使我们能获得针对状态价值及各个动作的注意力。通过获取并可视化这些详述智能体决策的注意力,我们实现了具有高可解释性的 DRL 模型。本文中,我们展示了在 Atari 2600 游戏中对注意力的可视化能够对各游戏任务下智能体决策进行细致分析。进一步的实验结果表明,我们的方法在部分游戏中可达到高于基线的性能。
引用
@article{arxiv.2306.13879,
title = {Action Q-Transformer: Visual Explanation in Deep Reinforcement Learning with Encoder-Decoder Model using Action Query},
author = {Hidenori Itaya and Tsubasa Hirakawa and Takayoshi Yamashita and Hironobu Fujiyoshi and Komei Sugiura},
journal= {arXiv preprint arXiv:2306.13879},
year = {2023}
}
备注
16 pages, 8 figures, 3 tables