RACCER:面向强化学习的可达且确定反事实解释
人工智能
2023-10-11 v2 机器学习
摘要
尽管强化学习(RL)算法已成功应用于众多任务,但其对神经网络的依赖使行为难以理解与信任。反事实解释是一种人类友好的解释,为用户提供可操作建议,告知如何改变模型输入以从黑盒系统获得期望输出。然而,当前RL中生成反事实的方法忽视了RL任务的随机与序列本质,可能产生难以获得或无法交付期望结果的反事实。本工作中,我们提出RACCER,首个针对RL智能体行为生成反事实解释的RL专用方法。我们首先提出并实现一组RL专用反事实属性,以确保易达且具高概率期望结果的反事实。我们利用对智能体执行轨迹的启发式树搜索,基于所定义属性寻找最合适反事实。我们在两个任务中评估RACCER,并开展用户研究以表明:与当前SOTA方法相比,RL专用反事实能帮助用户更好理解智能体行为。
引用
@article{arxiv.2303.04475,
title = {RACCER: Towards Reachable and Certain Counterfactual Explanations for Reinforcement Learning},
author = {Jasmina Gajcin and Ivana Dusparic},
journal= {arXiv preprint arXiv:2303.04475},
year = {2023}
}
备注
10 pages, 3 figures, 3 tables