面向在线数据混合的动态梯度对齐
机器学习
2024-10-04 v1 计算与语言
摘要
训练数据混合的组成对有效训练大型语言模型(LLM)至关重要,因为它直接影响其在下游任务上的性能。我们的目标是在仅获得少量示例的情况下,识别针对特定任务优化的LLM的最佳数据混合。传统方法包括经验性重加权方法、重要性抽样和梯度对齐技术。本文聚焦于梯度对齐,引入动态梯度对齐(Dynamic Gradient Alignment, DGA),一种可扩展的在线梯度对齐算法。DGA动态估计模型梯度与特定任务模型梯度对齐得最好的预训练数据混合。DGA是首个在计算开销方面几乎不高于标准预训练的方法,能够输出竞争性能的模型,无需重新训练模型。在实验方面,我们在两个关键场景中展示了相对于重要性抽样的显著改进:(i)当预训练集较小且重要性抽样因数据有限而出现过拟合时;(ii)当存在足够的专门数据时,导致重要性抽样停留在数据狭窄区域。我们的发现凸显了梯度对齐方法在优化训练数据混合方面的有效性,尤其是在数据受限的环境中,为在数据可用性有限的情况下提升LLM在特定任务上的性能提供了实用解决方案。
引用
@article{arxiv.2410.02498,
title = {Dynamic Gradient Alignment for Online Data Mixing},
author = {Simin Fan and David Grangier and Pierre Ablin},
journal= {arXiv preprint arXiv:2410.02498},
year = {2024}
}