中文

有向预测变化 - 用于局部特征归因方法的高效可靠保真度评估

机器学习 2025-11-27 v1 人工智能

摘要

解释方法的实用性严重依赖其对底层机器学习模型的保真度。尤其是在高风险医疗环境中,临床工作人员和监管机构需要能够忠实反映模型决策过程的解释。现有的保真度指标如 Infidelity 依赖蒙特卡罗近似,需要大量模型评估,并因随机抽样引入不确定性。本工作提出了一种用于评估局部特征归因方法保真度的新指标,通过修改现有的 Prediction Change (PC) 指标中的 Guided Perturbation Experiment 来实现。通过纳入扰动和归因的方向,该提议的有向预测变化 (DPC) 指标实现了近乎十倍的加速,并消除了随机性, resulting in 一个确定性且可信赖的评估程序,该程序测度量与局部 Infidelity 相同的属性。DPC 在两个数据集(皮肤皮损图像和金融表格数据)上进行评估,涉及两个黑箱模型、七种解释算法以及广泛的超参数。对于 4744 个不同的解释,结果表明 DPC 以及 PC 共同实现了对基线导向型和局部特征归因方法进行全面且计算高效评估的能力,同时提供了确定性和可重复的结果。

关键词

引用

@article{arxiv.2511.21363,
  title  = {The Directed Prediction Change - Efficient and Trustworthy Fidelity Assessment for Local Feature Attribution Methods},
  author = {Kevin Iselborn and David Dembinsky and Adriano Lucieri and Andreas Dengel},
  journal= {arXiv preprint arXiv:2511.21363},
  year   = {2025}
}

备注

13 pages, 10 figures, 5 tables, accepted at AAAI SECURE-AI4H workshop