针对 Adam 优化器的运行时数据Shapley值
机器学习
2026-03-10 v3 人工智能
摘要
可靠的数据归因对于缓解偏见和减少现代机器学习中的计算浪费至关重要,Shapley 值被视为理论上的黄金标准。虽然最近的“运行时”方法通过动态估计贡献来规避重新训练的昂贵成本,但它们严重依赖随机梯度下降 (SGD) 的线性结构,无法捕捉 Adam 等自适应优化器的复杂动态。本文我们展示数据归因本质上是优化器相关的:我们表明在 Adam 环境下,SGD 基于的代理与真实贡献显著发散 (Pearson R ≈ 0.11),导致其在现代训练管道中无效。为弥合这一差距,我们提出面向 Adam 的运行时数据Shapley值。我们推导一种闭式近似方法,通过重新定义固定状态下的效用来恢复可加性,并通过一种新颖的线性化幽灵近似实现可扩展计算。该技术对方差依赖缩放项进行线性化,使我们能够在不构造每个样本梯度的情况下计算两两梯度点积。大量实验表明,我们的方法在接近真实边际贡献的忠实度方面取得近乎完美的表现 (R > 0.99),同时保持约 95% 的常规训练吞吐量。此外,我们的 Adam-aware 归因在数据归因下游任务中显著优于 SGD 基于的基线方法。
引用
@article{arxiv.2602.00329,
title = {In-Run Data Shapley for Adam Optimizer},
author = {Meng Ding and Zeqing Zhang and Di Wang and Lijie Hu},
journal= {arXiv preprint arXiv:2602.00329},
year = {2026}
}
备注
16 pages