通过反事实动作结果解释强化学习智能体
人工智能
2023-12-19 v1 机器学习
摘要
可解释强化学习(XRL)方法旨在帮助阐明智能体策略和决策过程。大多数 XRL 方法侧重于局部解释,试图揭示智能体在特定世界状态下采取某种行为的原因。虽然这类解释既有用又必要,但它们通常不描述智能体所选动作的结果。在这项工作中,我们提出了“COViz”,一种新的局部解释方法,它直观地比较了智能体所选动作的结果与反事实动作的结果。与大多数提供智能体动机的有限状态观察的局部解释相比,我们的方法描绘了智能体从给定状态可能采取的其他轨迹及其结果。我们评估了 COViz 在支持人们理解智能体偏好方面的有用性,并将其与奖励分解(一种通过将智能体对不同动作的预期效用分解为有意义的奖励类型来描述该效用的局部解释方法)进行了比较。此外,我们研究了集成这两种方法的互补优势。我们的结果表明,这种集成显著提高了参与者的表现。
引用
@article{arxiv.2312.11118,
title = {Explaining Reinforcement Learning Agents Through Counterfactual Action Outcomes},
author = {Yotam Amitai and Yael Septon and Ofra Amir},
journal= {arXiv preprint arXiv:2312.11118},
year = {2023}
}
备注
Accepted to AAAI 2024