基于梯度的显著图在深度强化学习中是否有用?
机器学习
2020-12-03 v1
摘要
深度强化学习(DRL)将经典强化学习算法与深度神经网络相结合。DRL 中的一个问题是 CNN 是黑盒,难以理解智能体的决策过程。为了能够在对人类和机器高度危险的环境中使用 RL 智能体,开发者需要一种调试工具来确保智能体按预期行动。目前,奖励主要用于解释智能体的学习效果。然而,如果智能体通过记忆策略而非学习对环境作出响应来获得更多奖励,这可能会导致欺骗性的结论。本工作表明,该问题可借助梯度可视化技术识别。本工作将图像分类领域一些最知名的可视化方法引入深度强化学习领域。此外,开发了两种新的可视化技术,其中一项提供了尤为良好的结果。文中证明了这些算法在强化学习领域的可用程度。同时,也提出了在不同环境中使用不同可视化技术对 DRL 算法进行可视化的效果如何这一问题。
引用
@article{arxiv.2012.01281,
title = {Are Gradient-based Saliency Maps Useful in Deep Reinforcement Learning?},
author = {Matthias Rosynski and Frank Kirchner and Matias Valdenegro-Toro},
journal= {arXiv preprint arXiv:2012.01281},
year = {2020}
}
备注
8 pages, with appendix, 30 pages in total