擒贼先擒王:困难样本重加权持续训练提升 LLM 泛化能力
机器学习
2024-03-04 v2
摘要
在大型语言模型(LLMs)快速发展的领域,关键挑战之一是在高质量训练数据日益短缺的情况下增强其能力。我们的研究从一种经验策略出发,即利用原始预训练数据集对 LLM 进行轻量级持续训练,特别关注选择性保留那些产生中等高损失的样本。这些样本被认为对模型优化具有信息量和益处,这与因与数据噪声和复杂性相关而被丢弃的最高损失样本形成对比。随后,我们将此策略形式化为实例重加权分布鲁棒优化(IR-DRO)的原则性框架。IR-DRO 旨在通过实例重加权机制动态优先关注信息丰富的样本,并通过闭式解进行简化,以便轻松集成到现有的训练协议中。通过对各种模型和数据集的严格实验,我们的发现表明,我们的样本靶向方法在持续预训练和指令微调场景中,显著提高了 LLM 在多个基准测试上的性能。我们的代码可在 https://github.com/VITA-Group/HardFocusTraining 获取。
引用
@article{arxiv.2402.14270,
title = {Take the Bull by the Horns: Hard Sample-Reweighted Continual Training Improves LLM Generalization},
author = {Xuxi Chen and Zhendong Wang and Daouda Sow and Junjie Yang and Tianlong Chen and Yingbin Liang and Mingyuan Zhou and Zhangyang Wang},
journal= {arXiv preprint arXiv:2402.14270},
year = {2024}
}
备注
Preprint; updated reference and related works