中文

通过表征优化提升训练数据归因的效率

机器学习 2025-11-27 v2

摘要

训练数据归因(Training Data Attribution, TDA)方法旨在衡量训练数据对模型预测的影响。虽然梯度基方法(如 influence functions)提供了理论基础,但其计算成本高昂,难以用于大规模应用。表征基方法在可扩展性上远优于梯度方法,但通常依赖于用于归因而非针对归因优化的启发式嵌入,导致其保真度受限。为此,我们提出 AirRep,一种可扩展的基于表征的方法,通过学习与任务和模型对齐的表征来缩小这一差距,使其专为 TDA 优化。AirRep 引入两个关键创新:针对归因质量进行微调的可训练编码器,以及一种注意力式池化机制,使其能够准确估计组态影响。我们采用对自动构建的训练子集进行排序目标进行训练,这些子集由其对目标预测的经验效果所标记。针对指令调校过的大型语言模型(LLM)的实验表明,AirRep 在推理时几乎以梯度方法为量级的效率,同时实现了与最新梯度方法相当的性能。进一步分析表明,其鲁棒性和跨任务/跨模型的泛化能力。我们的代码已公开:https://github.com/sunnweiwei/AirRep

关键词

引用

@article{arxiv.2505.18513,
  title  = {Enhancing Training Data Attribution with Representational Optimization},
  author = {Weiwei Sun and Haokun Liu and Nikhil Kandpal and Colin Raffel and Yiming Yang},
  journal= {arXiv preprint arXiv:2505.18513},
  year   = {2025}
}

备注

NeurIPS 2025