利用深度强化学习学习序列反事实解释的公正策略
机器学习
2023-11-02 v1 人工智能
摘要
在可解释人工智能(XAI)领域,序列反事实(SCF)示例常被用于通过对输入实例实施一系列修改来改变已训练分类器的决策。尽管某些测试时算法旨在针对每个新实例单独优化,近期已有利用强化学习(RL)方法学习发现 SCF 的策略以提升可扩展性的提议。正如 RL 中常见的情况,RL 问题的形式化(包括状态空间、动作和奖励的设定)往往存在歧义。在本工作中,我们指出了现有方法中可能导致具有不良特性(如针对特定动作的偏差)的策略的缺陷。我们提议利用分类器的输出概率来构建更具信息量的奖励,以缓解该效应。
引用
@article{arxiv.2311.00523,
title = {Learning impartial policies for sequential counterfactual explanations using Deep Reinforcement Learning},
author = {E. Panagiotou and E. Ntoutsi},
journal= {arXiv preprint arXiv:2311.00523},
year = {2023}
}
备注
Accepted at the ECML PKDD 2023 Workshop: Explainable Artificial Intelligence From Static to Dynamic