用于可解释强化学习的因果状态蒸馏
机器学习
2024-04-02 v2 人工智能
统计方法学
摘要
强化学习(RL)是训练智能体的强大技术,但理解这些智能体为何做出特定决策可能极具挑战性。RL 模型缺乏透明度是一个长期存在的问题,使用户难以掌握智能体行为背后的原因。人们已探索多种方法来解决这一问题,其中一条有前景的途径是奖励分解(reward decomposition, RD)。RD 颇具吸引力,因为它规避了其他试图事后合理化智能体行为的方法所关联的一些问题。RD 通过揭示在训练过程中促成智能体目标的奖励的各个侧面来发挥作用。然而,仅靠 RD 存在局限性,因为它主要提供基于子奖励的见解,而未深入探究 RL 智能体神经模型内发生的错综复杂的因果关系。在本文中,我们提出了一种超越子奖励的 RD 扩展方法,以提供信息量更大的解释。我们的方法以因果学习框架为中心,利用信息论度量作为解释目标,鼓励因果因子具备三个关键属性:因果充分性、稀疏性和正交性。这些属性帮助我们提炼智能体状态与动作或奖励之间的因果关系,从而更深入地理解其决策过程。我们的框架旨在生成本地解释,并可应用于具有多个奖励通道的各种 RL 任务。通过一系列实验,我们证明了我们的方法能为智能体的动作选择提供更有意义和深刻的解释。
引用
@article{arxiv.2401.00104,
title = {Causal State Distillation for Explainable Reinforcement Learning},
author = {Wenhao Lu and Xufeng Zhao and Thilo Fryen and Jae Hee Lee and Mengdi Li and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:2401.00104},
year = {2024}
}
备注
https://lukaswill.github.io/; Accepted as oral by CLeaR 2024