SmallToLarge (S2L):通过总结小模型训练轨迹实现大语言模型微调的可扩展数据选择
计算与语言
2024-12-06 v2 人工智能
机器学习
摘要
尽管数据选择在大型语言模型(LLMs)的预训练和指令微调阶段行之有效,但由于微调数据的复杂性,提高特定领域监督微调(SFT)的数据效率仍面临重大挑战。为弥补这一差距,我们引入了一种有效且可扩展的 SFT 数据选择方法 SmallToLarge (S2L),该方法利用小模型的训练轨迹来指导大模型的数据选择。大量实验表明,S2L 显著提高了数学问题求解中 SFT 的数据效率,仅需原始 MathInstruct 数据集(Yue et al., 2023)11% 的训练数据即可匹配全数据集的性能,同时在 6 个域内和域外评估数据集上,平均优于最先进(SOTA)的数据选择算法 4.7%。值得注意的是,仅选择 50K 数据进行 SFT,S2L 在最具挑战性的 MATH(Hendrycks et al., 2021)基准测试中就达到了 32.7% 的准确率,比 Phi-2(Li et al., 2023b)提高了 16.6%。在 MIMIC-III 数据集(Johnson et al., 2016)上的临床文本摘要任务中,S2L 仅使用 50% 的数据便再次优于在全数据集上训练的效果。值得注意的是,S2L 可使用比目标模型小 40 倍的参考模型进行数据选择,从而按比例降低数据选择成本。
引用
@article{arxiv.2403.07384,
title = {SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models},
author = {Yu Yang and Siddhartha Mishra and Jeffrey N Chiang and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2403.07384},
year = {2024}
}