面向指令微调数据的可学习可扩展影响估计的神经网络
机器学习
2025-10-31 v4 人工智能
计算与语言
摘要
影响函数为模型训练提供了关键性见解,但现有方法存在计算成本高、泛化性有限等问题。尤其,近期工作提出了各种指标和算法用于计算数据影响,但在大规模模型和数据集上表现不佳。这源于计算中需要大量的前向和反向传播、存储大型模型的巨大内存需求,以及对新数据的影响估计泛化性差。本文探索使用小型神经网络(我们称之为InfluenceNetwork)来估计影响值,实现了最高可达99%的计算成本降低。我们的评估表明,影响值可使用仅占完整语言模型大小的0.0027%(我们采用7B和8B版本)的模型进行估计。我们将用于估计影响值的算法(称为NN-CIFT: Neural Networks for effiCient Instruction Fine-Tuning,面向指令微调的高效神经网络影响函数)应用于下游子集选择任务。我们包括四种最先进的影响函数,显示在NN-CIFT与原始影响函数之间以几乎不损失性能的情况下实现了显著加速。我们对NN-CIFT进行深入的超参数分析。本方法的代码可在https://github.com/agarwalishika/NN-CIFT 查阅。
引用
@article{arxiv.2502.09969,
title = {Neural Networks for Learnable and Scalable Influence Estimation of Instruction Fine-Tuning Data},
author = {Ishika Agarwal and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2502.09969},
year = {2025}
}