中文

HyperINF:釆尖方法的超级力量在数据影响估计中的释放

机器学习 2025-06-27 v2 机器学习

摘要

影响函数提供了一种原则性方法来评估单个训练样本对特定目标的贡献。然而,其高计算成本限制了其在大规模模型和数据集上的应用。现有方法虽显著降低了计算开销,但大多数情况下由于缺乏算法的强收敛保证,导致估计不准确。超级方法因其在矩阵逆逼近上的严格收敛保证而广为人知,而矩阵乘法运算在大规模模型上可能涉及不可处理的内存和计算成本。我们提出HyperINF,这是一种高效且准确的影响函数逼近方法,利用超级方法,具体为施鲁兹方法。为处理计算密集型矩阵乘法,我们将广义费舨尔信息 (GFIM) 作为Hessian矩阵的低秩逼近,从而将内存和计算开销降低为与秩数无关的常数成本。我们首先通过矩阵求逆的合成收敛仿真,展示了HyperINF相对于其他基线方法在准确性和稳定性方面的优势。进一步通过大量真实世界数据归因任务(包括误标记数据检测和LLM和VLM微调的数据选择),验证了HyperINF的有效性。在LoRA微调模型上,HyperINF以最小的内存和计算开销实现了优异的下游性能,而其他基线方法则因显著退化而表现不佳。我们的 codebases 地址为 https://github.com/Blackzxy/HyperINF。

关键词

引用

@article{arxiv.2410.05090,
  title  = {HyperINF: Unleashing the HyperPower of the Schulz's Method for Data Influence Estimation},
  author = {Xinyu Zhou and Simin Fan and Martin Jaggi},
  journal= {arXiv preprint arXiv:2410.05090},
  year   = {2025}
}