基于生成式深度学习的强化学习智能体反事实状态解释
人工智能
2021-02-01 v1 人机交互
机器学习
摘要
反事实解释处理“为何不?”情景,能为AI智能体的行为提供深刻洞见。本文聚焦于为在Atari等视觉输入环境中运行的深度强化学习(RL)智能体生成反事实解释。我们提出反事实状态解释,一种基于生成式深度学习的、以样例为导向的新型反事实解释方法。具体而言,反事实状态刻画了为使智能体选择不同动作,需对Atari游戏图像做的最小改动。我们还针对非机器学习专家的人类受试者评估了反事实状态的有效性。第一项用户研究考察人类能否分辨反事实状态解释是由实际游戏生成还是由生成式深度学习方法生成。第二项用户研究考察反事实状态解释能否帮助非专家受试者识别有缺陷的智能体;我们以基于最近邻解释(使用实际游戏图像)的基线方法作对比。结果表明,相较于最近邻基线及完全无解释,反事实状态解释对实际游戏图像具有足够保真度,使非专家能更有效地识别有缺陷的RL智能体。
引用
@article{arxiv.2101.12446,
title = {Counterfactual State Explanations for Reinforcement Learning Agents via Generative Deep Learning},
author = {Matthew L. Olson and Roli Khanna and Lawrence Neal and Fuxin Li and Weng-Keen Wong},
journal= {arXiv preprint arXiv:2101.12446},
year = {2021}
}
备注
Full source code available at https://github.com/mattolson93/counterfactual-state-explanations