基于影响蒸馏的大规模高效数据选择
计算与语言
2025-05-27 v1 机器学习
摘要
有效的数据选择对于现代大语言模型(LLM)的高效训练至关重要。本文提出影响蒸馏(Influence Distillation),一种利用二阶信息最优加权训练样本的新型数学合理的数据选择框架。通过蒸馏每个样本对目标分布的影响,我们的方法分配模型特定的权重,用于为 LLM 微调选择训练数据,引导其朝向目标领域的强性能。我们为梯度下降和 Adam 优化器分别推导了这些最优权重。为确保可扩展性并降低计算成本,我们提出了一种基于锚点的近似方法:影响在少量锚点样本上精确计算,然后高效传播至所有其他样本以确定其权重。我们通过在 Tulu V2 数据集上应用影响蒸馏进行指令微调,针对 Llama 和 Qwen 系列中的多个模型,在 GSM8k、SQuAD 和 MMLU 等一系列任务上进行了验证。实验表明,影响蒸馏在实现高达 3.5 倍选择加速的同时,匹配或超越了最先进性能。
引用
@article{arxiv.2505.19051,
title = {Efficient Data Selection at Scale via Influence Distillation},
author = {Mahdi Nikdan and Vincent Cohen-Addad and Dan Alistarh and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2505.19051},
year = {2025}
}