中文

我该选择哪种解释?从函数逼近视角刻画事后解释

机器学习 2023-01-02 v3 人工智能

摘要

事后可解释性(post hoc explainability)领域的一个关键问题是方法之间缺乏共同的基目标。例如,有些方法受函数逼近驱动,有些受博弈论概念驱动,还有些旨在获得清晰的可视化。这种目标碎片化不仅导致对解释的概念理解不一致,也带来了不知何时该用哪种方法的实际挑战。在本工作中,我们通过统一八种流行的事后解释方法(LIME、C-LIME、KernelSHAP、Occlusion、Vanilla Gradients、Gradients x Input、SmoothGrad和Integrated Gradients)来着手应对这些挑战。我们表明这些方法都对黑盒模型执行局部函数逼近,仅在于执行逼近所用的邻域和损失函数不同。这一统一使我们能够(1)陈述解释方法的无免费午餐定理,证明没有方法能在所有邻域上最优;(2)提供基于忠实于黑盒模型来选择方法的指导原则。我们使用各种真实世界数据集、模型类别和预测任务对这些理论结果进行了实证验证。通过将多样的解释方法纳入一个共同框架,本工作(1)推进了对这些方法的概念理解,揭示了它们共享的局部函数逼近目标、性质及彼此关系;(2)指导了这些方法在实践中的使用,提供了选择方法的原理性途径,并为创造新方法铺平了道路。

关键词

引用

@article{arxiv.2206.01254,
  title  = {Which Explanation Should I Choose? A Function Approximation Perspective to Characterizing Post Hoc Explanations},
  author = {Tessa Han and Suraj Srinivas and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2206.01254},
  year   = {2023}
}