中文

信息性后验解释仅存在于简单函数中

机器学习 2025-08-18 v1 人工智能

摘要

许多研究人员认为,可以使用局部后验解释算法来洞察复杂机器学习模型的行为。然而,仅存在于简单决策函数的理论保证,而对于复杂模型是否可能以及在何种假设下可能存在类似结果尚不清楚。本文引入了一个通用的、基于学习理论的框架,用于定义后验解释是否提供关于决策函数的解释。我们称解释为信息性的,如果它用于减少合理决策函数空间的复杂性。通过这一方法,我们表明,许多流行的解释算法在应用于复杂决策函数时并不具备信息性,严格地否定了任何模型都应该可以被解释的观念。随后,我们推导出不同的解释算法变得具备信息性的条件。这通常比人们期望的更强。例如,梯度解释和反事实解释相对于可微函数空间而言是非信息性的,而SHAP和锚解释相对于决策树空间而言也不具备信息性。基于这些结果,我们讨论了如何修改解释算法以使其具备信息性。虽然本文提出的解释算法分析是数学性的,但我们认为这对实际应用这些算法具有强大的影响,特别是对于审计、监管和高风险AI应用。

关键词

引用

@article{arxiv.2508.11441,
  title  = {Informative Post-Hoc Explanations Only Exist for Simple Functions},
  author = {Eric Günther and Balázs Szabados and Robi Bhattacharjee and Sebastian Bordt and Ulrike von Luxburg},
  journal= {arXiv preprint arXiv:2508.11441},
  year   = {2025}
}