中文

重新定义强化学习的反事实解释:综述、挑战与机遇

人工智能 2024-02-12 v2

摘要

尽管AI算法在各领域取得显著成功,其缺乏透明性阻碍了在现实任务中的应用。尽管面向非专家的解释对用户信任与人机协作必不可少,多数AI解释方法仍聚焦于开发者与专家用户。反事实解释是局部解释,为用户提供关于在输入中作何改动可使黑盒模型输出改变的建言。反事实具用户友好性,并为从AI系统获得期望输出提供可操作建议。虽然在监督学习中已被广泛研究,将其应用于强化学习(RL)的方法却很少。本工作中,我们探究这一强大解释方法在RL中代表性不足的原因。我们首先回顾监督学习中反事实解释的现有工作。此外,我们探究监督学习与RL中反事实解释的差异,并识别阻碍监督方法迁入强化学习的主要挑战。最后,我们为RL重新定义反事实,并提出在RL中实现反事实的研究方向。

关键词

引用

@article{arxiv.2210.11846,
  title  = {Redefining Counterfactual Explanations for Reinforcement Learning: Overview, Challenges and Opportunities},
  author = {Jasmina Gajcin and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2210.11846},
  year   = {2024}
}

备注

32 pages, 6 figures