中文

面向大语言模型训练的领域影响感知数据抽样 (DIDS)

计算与语言 2025-08-25 v2 人工智能 机器学习

摘要

大语言模型(LLMs)通常在多领域数据集上进行训练,领域抽样策略对模型性能具有显著影响,因为不同领域在下游任务中的重要性各异。现有的领域级抽样策略优化方法在保持领域内部一致性和准确衡量领域影响方面存在挑战。本文提出了领域影响感知数据抽样(DIDS)。为确保领域内部一致性,提出了一种梯度聚类算法,基于学习效果对训练数据进行分组,其中采用代理语言模型和降维技术以降低计算开销。为准确衡量领域影响,我们开发了基于Fisher信息矩阵(FIM)的指标,用于量化领域特定的参数更新如何影响下游任务上模型输出分布,并提供了理论保证。此外,为确定最优抽样比例,DIDS结合了FIM指导的领域影响评估和损失学习轨迹(后者指示领域特定潜力),并考虑边际报酬递减。大量实验表明,DIDS在保持可 comparable 训练效率的同时,实现了平均性能提升3.4%。代码已公开于 https://github.com/shiweijiezero/DIDS。

关键词

引用

@article{arxiv.2504.13227,
  title  = {DIDS: Domain Impact-aware Data Sampling for Large Language Model Training},
  author = {Weijie Shi and Jipeng Zhang and Yaguang Wu and Jingzhi Fang and Ruiyuan Zhang and Jiajie Xu and Jia Zhu and Hao Chen and Yao Zhao and Sirui Han and Xiaofang Zhou},
  journal= {arXiv preprint arXiv:2504.13227},
  year   = {2025}
}