数据多样性对鲁棒指令微调至关重要
计算与语言
2024-11-12 v3 机器学习
摘要
近期研究表明,通过精心构建高质量且多样化的指令微调数据集,可显著提升指令遵循能力。然而,此类数据集的构建十分困难,且多数工作依赖人工整理或专有语言模型。自动数据整理之所以困难,是因为迄今仍不明确我们如何定义指令微调的多样性、多样性与质量如何相互依赖,以及我们如何优化数据集的质量与多样性。为解决这些问题,我们提出一种新算法——质量-多样性指令微调(QDIT)。QDIT提供了一种同时控制数据集多样性与质量的简便方法,使我们能深入研究所多样性与质量对指令微调性能的影响。由此研究我们得出两个关键见解:(1)数据多样性与质量之间存在天然权衡;(2)提升数据多样性可显著改善最坏情况指令遵循性能,从而增强鲁棒性。我们在多个大规模指令微调数据集上验证了QDIT的性能,发现相较于质量驱动的数据选择,它能大幅改善最坏与平均情况性能。
引用
@article{arxiv.2311.14736,
title = {Data Diversity Matters for Robust Instruction Tuning},
author = {Alexander Bukharin and Shiyang Li and Zhengyang Wang and Jingfeng Yang and Bing Yin and Xian Li and Chao Zhang and Tuo Zhao and Haoming Jiang},
journal= {arXiv preprint arXiv:2311.14736},
year = {2024}
}
备注
22 pages, 18 figures