中文

Newton步法与影响函数数据归因的准确性分析

机器学习 2026-05-19 v2 机器学习

摘要

数据归因旨在通过估算在删除某些训练点后模型预测的变化来解释模型预测,广泛应用于可解释性、信用分配、忘却和隐私等领域。即便在Logistic回归这一相对简单的情况下,现有的影响函数(IF)和单次 Newton 步(NS)等主流数据归因方法的已有数学分析也仅在两个关键方面有限。首先,它们依赖全局强凸假设,而实际中往往不满足。其次,所得界限随参数个数(dd)和删除样本数(kk)规模增长得非常糟糕。因此,这些分析不够紧密,无法回答诸如“这些方法的误差渐近规模是什么?”或“对于给定数据集,哪种方法更准确?”等根本问题。本文提出了一种对 NS 和 IF 数据归因方法进行新分析的框架,适用于凸学习问题。据我们所知,这是第一项不假设全局强凸性并解释 [KATL19] 和 [RH25a] 观察到的 NS 数据归因通常比 IF 更准确的分析。我们证明,对于足够良好行为的Logistic回归,我们的界限在多项对数因子下渐近紧密,给出样本删除平均误差的规模定律。

关键词

引用

@article{arxiv.2512.12572,
  title  = {On the Accuracy of Newton Step and Influence Function Data Attributions},
  author = {Ittai Rubinstein and Samuel B. Hopkins},
  journal= {arXiv preprint arXiv:2512.12572},
  year   = {2026}
}