中文

事后解释对于检测未知虚假相关性可能无效

机器学习 2022-12-12 v1

摘要

我们研究了三类事后模型解释——特征归因、概念激活与训练点排序——在检测模型对训练数据中虚假信号的依赖时是否有效。具体而言,我们考虑待检测的虚假信号在测试时对解释方法使用者未知的场景。我们设计了一种经验方法,使用半合成数据集与预先指定的虚假伪影来获得可验证地依赖这些虚假训练信号的模型。随后我们提供了一套指标,用于在多种条件下评估解释方法对虚假信号检测的可靠性。我们发现,当虚假伪影在测试时未知时,所测试的事后解释方法无效,尤其是对于背景模糊等不可见伪影。此外,我们发现特征归因方法易于错误地指示对虚假信号的依赖,即使被解释的模型并不依赖虚假伪影。这一发现令人生疑:在从业者手中,这些方法的效用在于检测模型对虚假信号的依赖。

关键词

引用

@article{arxiv.2212.04629,
  title  = {Post hoc Explanations may be Ineffective for Detecting Unknown Spurious Correlation},
  author = {Julius Adebayo and Michael Muelly and Hal Abelson and Been Kim},
  journal= {arXiv preprint arXiv:2212.04629},
  year   = {2022}
}