中文

First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation

计算与语言 2026-01-29 v2 人工智能 机器学习

摘要

识别大型语言模型(LLM)决策中训练样本的影响/影响力对于有效解释模型决策和审计大规模数据集至关重要。当前的训练样本影响估计方法(也称为影响函数)通过利用通过模型的第一阶和高阶梯度项的信息流来实现这一目标。然而,由于当今大型模型由数十亿参数构成,这些影响计算常常受限于某些模型层的子集,以确保计算可行性。Prior的著名工作Yeh等人(2022)在评估哪些层最适合计算语言数据影响时得出结论,即第一(嵌入)层最具信息量,基于影响得分相互抵消(即取消效应)的假设。在本文中,我们提出了关于取消效应不可靠性的理论和实证证据,证明中间注意力层是更好的影响估计器。此外,我们解决了跨层聚合影响得分的更广泛问题,展示了除标准平均值之外的其他方法(如排序和投票-based方法)如何显著提高性能。最后,我们提出了更好的方法来评估LLMs中影响得分的有效性,而无需进行模型重新训练,我们提出了一种新指标即噪声检测率(NDR),其预测能力强于取消效应。通过对不同类型和规模的LLMs进行大量实验,我们具体确定,第一(层)并不一定比最后(层)在LLM影响估计中更好,与该领域的先前知识相矛盾。

关键词

引用

@article{arxiv.2511.04715,
  title  = {First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation},
  author = {Dmytro Vitel and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2511.04715},
  year   = {2026}
}

备注

Accepted to ICLR 2026