通过迭代选择学习提升大语言模型
计算与语言
2024-12-24 v1 人工智能
摘要
当下数据集通常由多个来源构建并使用不同的合成技术,这使得在用于后训练前进行数据去噪和去重至关重要。本文提出通过迭代数据选择(\ApproachName{})进行指令调优。我们同时从复杂度和多样性两个维度衡量样本质量。与在微调前一次性计算复杂度得分不同,我们强调在微调期间更新该模型特定得分的重要性,以准确适应模型的动态变化。在此基础上,多样性得分考虑了样本响应的可获取性。IterIT 通过迭代更新得分最高样本的复杂度得分,并贪心选择复杂度-多样性得分最高的样本,实现了两者优势的融合。在多个指令调优数据集上的实验表明,IterIT 相较于强基线 consistently 实现了提升。此外,我们的方法在领域特定场景和不同骨干模型上也表现出良好的概括性。所有资源将在 https://github.com/JiaQiSJTU/IterIT 提供。
引用
@article{arxiv.2412.17365,
title = {Boosting LLM via Learning from Data Iteratively and Selectively},
author = {Qi Jia and Siyu Ren and Ziheng Qin and Fuzhao Xue and Jinjie Ni and Yang You},
journal= {arXiv preprint arXiv:2412.17365},
year = {2024}
}