中文

f-INE:基于假设检验的训练随机性下影响估计框架

机器学习 2026-04-06 v2 人工智能

摘要

影响估计方法虽然可用于解释和调试机器学习模型,方法通过估计单个样本对最终模型的影响。然而,现有方法在训练随机性下会崩溃:相同的示例在一次运行中可能至关重要,而在另一次运行中则无关紧要。这种不稳定性削弱了其在数据清理中的应用,因为难以确定我们是否删除/保留了正确的数据点。为克服此问题,本文引入一种新的影响估计框架f-影响量(f-influence),其基于假设检验,显式地考虑训练随机性,并建立了使其适用于可靠影响估计的理想属性。我们还设计了一个高度高效的算法f-INE(f-**IN**fluence **E**stimation),该算法在单个训练运行中计算f-影响量。最后,我们将f-INE扩展到Llama-3.1-8B的指令调优数据上,表明其可以可靠地检测到操纵模型意见的受感染样本,证明了其在数据清理和归因模型行为方面的实用性。

关键词

引用

@article{arxiv.2510.10510,
  title  = {f-INE: A Hypothesis Testing Framework for Estimating Influence under Training Randomness},
  author = {Subhodip Panda and Dhruv Tarsadiya and Shashwat Sourav and Prathosh A. P and Sai Praneeth Karimireddy},
  journal= {arXiv preprint arXiv:2510.10510},
  year   = {2026}
}