自我解释的决策:一种以用户为中心的深度强化学习解释系统
人机交互
2022-12-13 v2
摘要
随着自动驾驶等深度强化学习(RL)系统被广泛部署却仍基本不透明,开发者频繁使用可解释 RL(XRL)工具来更好地理解和运用深度 RL 智能体。然而,以往的 XRL 研究采用以技术为中心的研究路径,忽视了 RL 开发者如何感知所生成的解释。通过一项预备研究,我们明确了 RL 从业者使用 XRL 方法的主要目标,以及拉大现有 XRL 方法与此目标之间差距的四大陷阱。这些陷阱包括难以触及的推理过程、不一致或无法理解的解释,以及无法泛化的解释。为弥补所发现的差距,我们提出一种基于反事实推理的解释方法,该方法能揭示 RL 智能体推理过程的细节并生成自然语言解释。围绕此方法,我们构建了一个交互式 XRL 系统,用户可主动探索解释及有影响力的信息。在一项有 14 名参与者的用户研究中,我们验证道:相比基线方法,开发者借助我们的系统多识别出 20.9% 的 RL 智能体异常行为与局限;且在自动驾驶任务中,使用我们的系统帮助终端用户在可操作性测试中表现提升 25.1%,在《星际争霸 II》微操任务中提升 16.9%。
引用
@article{arxiv.2212.00888,
title = {Decisions that Explain Themselves: A User-Centric Deep Reinforcement Learning Explanation System},
author = {Xiaoran Wu and Zihan Yan and Chongjie Zhang and Tongshuang Wu},
journal= {arXiv preprint arXiv:2212.00888},
year = {2022}
}