中文

GANterfactual-RL:通过视觉反事实解释理解强化学习智能体的策略

机器学习 2023-02-27 v1 人工智能

摘要

反事实解释是解释人工智能模型的常用工具。对于强化学习(RL)智能体,它们通过说明需要对状态做何种最小改变才能使智能体选择不同动作,来回答“为何不?”或“如果……会怎样?”的问题。由于状态空间巨大且决策属于包含长期决策的总体策略的一部分,为具有视觉输入的RL智能体生成反事实解释尤其具有挑战性。然而,专门针对具有视觉输入的RL智能体的反事实解释研究很少,且未超越识别缺陷智能体的范畴。目前尚不清楚反事实解释对于分析不同智能体所学策略或为特定任务选择合适智能体等更复杂任务是否仍有帮助。我们提出了一种新颖而简单的方法,通过将问题表述为域迁移问题来为RL智能体生成反事实解释,该方法允许使用StarGAN等对抗学习技术。我们的方法完全与模型无关,并且我们证明其在若干计算指标上优于此前唯一的方法。此外,我们在用户研究中表明,在分析不同智能体所追求的策略时,我们的方法表现最佳。

关键词

引用

@article{arxiv.2302.12689,
  title  = {GANterfactual-RL: Understanding Reinforcement Learning Agents' Strategies through Visual Counterfactual Explanations},
  author = {Tobias Huber and Maximilian Demmler and Silvan Mertes and Matthew L. Olson and Elisabeth André},
  journal= {arXiv preprint arXiv:2302.12689},
  year   = {2023}
}