用强化学习训练特征函数:XAI方法对战四子棋
机器学习
2022-02-28 v2
摘要
可解释人工智能(XAI)的目标之一是确定哪些输入成分对分类器决策是相关的。这通常被称为显著性归因(saliency attribution)。特征函数(来自合作博弈论)能够评估部分输入,并构成诸如Shapley值等理论上“公平”的归因方法的基础。在仅给定标准分类器函数的情况下,部分输入应如何实现并不明确。相反,大多数针对神经网络等黑盒分类器的XAI方法考虑通常位于流形外的反事实输入。这使得它们难以评估且易于操纵。我们提出了一种直接以神经网络形式训练特征函数以进行简单双人游戏的设定。我们将其应用于四子棋(Connect Four)游戏,在训练期间随机向我们的智能体隐藏颜色信息。这对于比较XAI方法具有三个优势:它缓解了关于如何实现部分输入的模糊性,使流形外评估变得不必要,并允许我们通过让这些方法相互对弈来进行比较。
引用
@article{arxiv.2202.11797,
title = {Training Characteristic Functions with Reinforcement Learning: XAI-methods play Connect Four},
author = {Stephan Wäldchen and Felix Huber and Sebastian Pokutta},
journal= {arXiv preprint arXiv:2202.11797},
year = {2022}
}
备注
19 pages, 9 figures, 1 table