利用函数分解统一基于归因的解释
机器学习
2024-12-19 v1 人工智能
摘要
机器学习中的黑盒问题促使人们为复杂模型引入了越来越多的解释方法。这些解释具有不同的属性,进而导致了方法选择问题:对于给定的用例,哪种解释方法最合适?在这项工作中,我们提出了一个基于归因的解释方法的统一框架,为严格研究解释的相似性和差异性迈出了一步。我们首先引入了基于移除的归因方法 (RBAMs),并表明现有方法中广泛广泛的选择都可以被视为此类 RBAMs。然后,我们引入了规范加性分解 (CAD)。这是一种基于移除(组)特征的中心思想对任何函数进行加性分解的一般构造。我们接着证明,确实每一个有效的加性分解都是 CAD 的一个实例,并且任何基于移除的归因方法都与特定的 CAD 相关联。接下来,我们表明任何基于移除的归因方法都可以完全定义为一个特定(可能是常数平移的)合作博弈的博弈论值或交互指数,该合作博弈是使用该方法的相应 CAD 定义的。然后,我们利用这种内在联系来定义解释方法特定行为的形式化描述(我们也称之为函数公理),并确定了归因方法的相应 CAD 和博弈论值或交互指数的充分条件,在这些条件下,该归因方法保证遵循这些函数公理。最后,我们展示了如何使用这个统一框架来为现有解释方法开发新的、高效的近似。
引用
@article{arxiv.2412.13623,
title = {Unifying Attribution-Based Explanations Using Functional Decomposition},
author = {Arne Gevaert and Yvan Saeys},
journal= {arXiv preprint arXiv:2412.13623},
year = {2024}
}