为何?为何不?何时?强化学习中智能体行为的可视化解释
人机交互
2021-11-02 v2
摘要
强化学习(RL)被用于诸多领域,包括自动驾驶、机器人、股票交易和视频游戏。遗憾的是,RL 智能体的黑箱性质,加之法律与伦理考量,使得人类(包括那些并非 RL 专家的人)理解 RL 智能体所采取动作背后的推理日益重要,尤其在安全关键领域。为应对这一挑战,我们引入了 PolicyExplainer,一个允许用户直接查询自主智能体的可视化分析界面。PolicyExplainer 可视化智能体的状态、策略与期望未来奖励,并支持提出与回答诸如以下问题:为何采取此动作?为何不采取另一动作?何时采取此动作?PolicyExplainer 基于与 RL 研究人员的领域分析设计,并通过在三个领域(出租车导航、堆叠机器人领域以及 HIV 患者的药物推荐)上的定性与定量评估进行评价。我们发现,相较于最先进的基于文本的解释方法,PolicyExplainer 能更好地增进对智能体决策的信任与理解。与领域从业者的访谈进一步验证了 PolicyExplainer 在安全关键领域的应用。我们的结果有助于展示基于可视化的方法如何被用于解码自主 RL 智能体的行为,尤其面向 RL 非专家。
引用
@article{arxiv.2104.02818,
title = {Why? Why not? When? Visual Explanations of Agent Behavior in Reinforcement Learning},
author = {Aditi Mishra and Utkarsh Soni and Jinbin Huang and Chris Bryan},
journal= {arXiv preprint arXiv:2104.02818},
year = {2021}
}