不完美影响、保留排序:TRAK 数据归因理论
机器学习
2026-02-03 v1
摘要
数据归因(data attribution)即追踪模型预测背后的具体训练数据,是解释复杂 AI 模型的重要工具。广泛使用的 TRAK 算法通过首先用核机器近似底层模型,然后利用近似留一次删除(ALO)风险的技术来解决这一挑战。尽管其在实际应用中表现优异,但 TRAK 近似在何处准确、何处失效的理论条件仍 largely 未被探讨。本文对 TRAK 算法进行理论分析,阐述其性能特征,并量化其依赖的近似所引入的误差。我们表明,尽管这些近似会引入显著误差,但 TRAK 的估计影响仍高度与原始影响相关,从而在很大程度上保留了数据点之间的相对排序。我们通过大量仿真和实证研究来佐证理论结果。
引用
@article{arxiv.2602.01312,
title = {Imperfect Influence, Preserved Rankings: A Theory of TRAK for Data Attribution},
author = {Han Tong and Shubhangi Ghosh and Haolin Zou and Arian Maleki},
journal= {arXiv preprint arXiv:2602.01312},
year = {2026}
}