DONOD:基于模型内在数据剪枝的高效通用指令微调
人工智能
2025-08-11 v2 机器学习
摘要
大型语言模型(LLM)的指令式微调在特定领域适应方面被广泛采用。虽然领域特定的监督微调(SFT)有效且高效,但往往削弱了跨域泛化能力,并难以处理噪声训练数据。为此,我们提出了 DONOD,一种轻量级模型内在数据剪枝方法。该方法采用两种基于模型参数的指标评估数据:Delta of Norm(DON),捕捉对模型权重累积影响;Norm of Delta(NOD),量化权重不稳定性。此外,借助技术顺序偏好相似性理想解(TOPSIS)算法,我们在无需辅助模型的情况下有效筛选出噪声、不可学习且损害泛化的样本。在数学任务上的实验表明,DONOD 选择的数据在微调效率和对噪声数据的鲁棒性方面均表现优异。通过筛除 70% 的数据集,我们在目标域准确率提升 14.90%,跨域准确率提升 5.67%。同时,我们选定的数据在跨架构泛化方面表现优越。使用较小模型(如 Llama 3.1-8B)剪枝的数据可有效泛化到更大模型(如 Llama 2-13B)。与现有方法相比,DONOD 在保持数据agnostic 的同时表现出 Comparable 或更好的性能,具备更广泛的适用性。代码将公开发布。
引用
@article{arxiv.2504.14810,
title = {DONOD: Efficient and Generalizable Instruction Fine-Tuning for LLMs via Model-Intrinsic Dataset Pruning},
author = {Jucheng Hu and Surong Yang and Lijun Wu and Dongzhan Zhou},
journal= {arXiv preprint arXiv:2504.14810},
year = {2025}
}