强化学习中的反事实解释策略
人工智能
2023-07-26 v1 机器学习
摘要
随着强化学习(RL)智能体越来越多地被用于利用奖励偏好的各类决策问题,确保这些框架所学得的、将观测映射到可能动作概率分布的策略具有可解释性变得十分重要。然而,以对比方式对这些复杂策略进行系统性理解的工作极少甚至没有,即:对策略做何种最小改动可将其性能改善/恶化至期望水平。在本文中,我们提出COUNTERPOL,首个利用以导致期望结果的最小策略改动为形式的反事实解释来分析RL策略的框架。为此,我们将RL中的监督学习里引入反事实,并以期望回报调节目标结果。我们建立了Counterpol与RL中广泛使用的基于信赖域的策略优化方法之间的理论联系。大量实证分析显示了COUNTERPOL在生成(不)学习技能的解释同时保持接近原策略方面的有效性。我们在五个具有不同状态与动作空间的RL环境上的结果展示了反事实解释的效用,为设计和开发反事实策略的新前沿铺平了道路。
引用
@article{arxiv.2307.13192,
title = {Counterfactual Explanation Policies in RL},
author = {Shripad V. Deshmukh and Srivatsan R and Supriti Vijay and Jayakumar Subramanian and Chirag Agarwal},
journal= {arXiv preprint arXiv:2307.13192},
year = {2023}
}
备注
ICML Workshop on Counterfactuals in Minds and Machines, 2023