中文

学习解释:一种用于解释黑盒模型的模型无关框架

计算机视觉与模式识别 2023-10-26 v1 人工智能

摘要

我们提出学习解释(Learning to Explain,LTX),一种为视觉模型提供事后解释的模型无关框架。LTX框架引入一个“解释器”模型来生成解释图,突出证明被解释模型所作预测的关键区域。为训练该解释器,我们采用由初始预训练与逐实例微调组成的两阶段过程。在这两个训练阶段中,我们采用一种独特配置,将被掩码输入的被解释模型预测与其未掩码原始输入预测进行比较。该方法使得能够使用一种新颖的反事实目标,旨在利用输入图像的掩码版本来预测模型的输出。重要的是,LTX框架不局限于特定模型架构,可为基于Transformer和卷积的模型提供解释。通过评估,我们证明LTX在各种指标上显著优于当前最先进的可解释性方法。

关键词

引用

@article{arxiv.2310.16584,
  title  = {Learning to Explain: A Model-Agnostic Framework for Explaining Black Box Models},
  author = {Oren Barkan and Yuval Asher and Amit Eshel and Yehonatan Elisha and Noam Koenigstein},
  journal= {arXiv preprint arXiv:2310.16584},
  year   = {2023}
}