中文

平衡大语言模型合成数据生成策略的成本与效果

计算与语言 2024-10-31 v3 机器学习

摘要

随着大语言模型(LLM)被应用于更多用例,为微调创建高质量、任务特定的数据集成为模型改进的瓶颈。使用高质量人工数据是释放模型性能的最常见方法,但在许多场景下成本过高。一些替代方法也已出现,例如生成合成数据或混合数据,但这些方法的有效性仍不明确,尤其是在资源受限的场景和不易验证的任务中。为探究此问题,我们将各种合成数据生成策略归纳为三个代表性类别——答案增强、问题改写和新问题生成——并研究了在不同约束条件(即种子指令集大小和查询预算)下训练的学生LLM的性能。我们证明,这些策略在不同设置下并非同样有效。值得注意的是,最优的数据生成策略强烈依赖于可用教师查询预算与种子指令集大小之间的比率。当该比率较低时,为现有问题生成新答案最为有效;但随着该比率增加,生成新问题变为最优。在所有任务中,我们发现,与高数据量场景相比,在低到中等数据量场景下,增强方法和其他设计选择的选择更为重要。我们提供了一个实用框架,用于在不同设置下选择合适的增强方法,同时考虑了每种方法的可扩展性、验证合成数据的重要性以及使用不同LLM进行合成数据生成等其他因素。

关键词

引用

@article{arxiv.2409.19759,
  title  = {Balancing Cost and Effectiveness of Synthetic Data Generation Strategies for LLMs},
  author = {Yung-Chieh Chan and George Pu and Apaar Shanker and Parth Suresh and Penn Jenks and John Heyer and Sam Denton},
  journal= {arXiv preprint arXiv:2409.19759},
  year   = {2024}
}

备注

NeurIPS '24 Workshop on Fine-Tuning in Modern Machine Learning: Principles and Scalability