中文

DRLViz:理解深度强化学习中的决策与记忆

机器学习 2020-05-26 v2 人工智能 人机交互 神经与进化计算 机器学习

摘要

我们提出 DRLViz,一个用于解释经深度强化学习训练的智能体(如机器人)内部记忆的可视化分析界面。该记忆由智能体在环境中移动时更新的大型时序向量构成,因其维度数量、对过去向量的依赖、时空相关性以及维度间的共相关性而难以直观理解。它常被视为黑箱,因为只有输入(图像)和输出(动作)对人类是可理解的。借助 DRLViz,专家可以通过记忆降维交互来辅助解释决策,并在发生错误(例如错误方向)时探究记忆各部分的作用。我们报告了 DRLViz 在视频游戏模拟器(ViZDoom)中应用于一个带有物品收集任务的导航场景的情况。我们还报告了专家使用 DRLViz 的评估结果、DRLViz 对模拟游戏之外其他场景和导航问题的适用性,以及它在可视化分析领域对黑箱模型可解释性与可说明性的贡献。

关键词

引用

@article{arxiv.1909.02982,
  title  = {DRLViz: Understanding Decisions and Memory in Deep Reinforcement Learning},
  author = {Theo Jaunet and Romain Vuillemot and Christian Wolf},
  journal= {arXiv preprint arXiv:1909.02982},
  year   = {2020}
}