中文

局部不变解释:通过局部不变学习实现稳定且单向的解释

机器学习 2023-10-04 v2 人工智能

摘要

局部可解释模型无关解释(LIME)方法是用于逐样本解释黑盒模型最流行的方法之一。尽管已有许多变体被提出,但很少能提供简单的方式来产生高保真且稳定、直观的解释。本工作中,我们受不变风险最小化(IRM)原则——最初为(全局)分布外泛化而提出——的启发,提出一种模型无关的局部解释方法,以提供此类高保真且在邻近样本间稳定且单向的解释。我们的方法基于博弈论公式,我们从理论上证明,该方法强烈倾向于消除在待解释样本邻域内黑盒函数梯度突然变号的特征,而在其他情况下则更为谨慎,会选择更保守的(特征)归因,这种行为对于补救而言可能是高度可取的。在实证上,我们在表格、图像和文本数据上表明,使用随机扰动形成邻域时,我们的解释质量远优于LIME,且在某些情况下甚至可与使用从数据流形采样的真实邻居的其他方法相媲美。考虑到学习流形以创建真实邻居或投影解释通常代价高昂甚至不可能,这是可取的。此外,我们的算法训练简单高效,且能在无诸如(部分)因果图等侧信息的情况下确定黑盒局部决策的稳定输入特征,而近期一些工作使用了此类侧信息。

关键词

引用

@article{arxiv.2201.12143,
  title  = {Locally Invariant Explanations: Towards Stable and Unidirectional Explanations through Local Invariant Learning},
  author = {Amit Dhurandhar and Karthikeyan Ramamurthy and Kartik Ahuja and Vijay Arya},
  journal= {arXiv preprint arXiv:2201.12143},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023