面向非分解损失的数据归因的通用影响函数
机器学习
2024-12-03 v1 机器学习
摘要
影响函数是一种源自稳健统计学的技术,已在现代机器学习中被改编用于新应用:数据归因——量化单个训练数据点对模型预测的影响。然而,数据归因文献中对影响函数的常见推导仅限于可分解为单个数据点损失之和的损失函数,最突出的示例已知为 M-estimator。这限制了影响函数的应用范围至更复杂的学习目标,即我们称之为非分解损失,如对比损失或排序损失,其中单个损失项依赖于多个数据点且无法进一步分解。本文通过重新审视稳健统计学中影响函数的通用公式,来弥合这一差距,该公式超出了 M-estimator。基于此公式,我们提出了一种新方法,即通用影响函数(VIF),可直接应用于任何非分解损失训练的机器学习模型。在与统计学中的经典方法相比,所提出的 VIF 旨在充分利用自动微分的强大功能,从而消除对每个损失函数特定推导的需求。我们在三个示例中展示了 VIF 的有效性:用于生存分析的 Cox 回归、用于网络分析的节点嵌入,以及用于信息检索的列表级学习排序。在所有情况下,VIF 估计的影响都接近通过暴力留一回归获得的结果,同时计算速度快达 倍。我们相信 VIF 代表了数据归因领域的重大进展,使之能够高效地跨越广泛的机器学习范畴,具有广泛的实际应用潜力。
引用
@article{arxiv.2412.01335,
title = {A Versatile Influence Function for Data Attribution with Non-Decomposable Loss},
author = {Junwei Deng and Weijing Tang and Jiaqi W. Ma},
journal= {arXiv preprint arXiv:2412.01335},
year = {2024}
}