中文

调查大语言模型合成数据中质量、多样性和复杂度的影响

机器学习 2024-12-11 v2 人工智能 计算与语言

摘要

使用大型语言模型生成合成数据是一个在几乎无限范围的任务中增强自然数据的有前景的范例。鉴于这种多样性,合成数据生成算法之间的直接比较极少,使人们难以理解改进来自何处以及存在何种瓶颈。我们提出通过合成数据的质量、多样性和复杂度三种特性来评估算法。我们选择这些特性是因为它们在开放性过程中具有重要意义,且每种特性对下游模型的能力都有所影响。我们发现质量对于分布内模型泛化至关重要,多样性对于分布外泛化至关重要,而复杂度对两者都有益。此外,我们强调在训练数据中存在质量-多样性权衡及其对模型性能的下游影响。我们然后检查合成数据管道的各个组件对每种数据特性的影响。这种检查允许我们通过所利用的组件以及结果对数据QDC组成的影响来对合成数据生成算法进行分类和比较。该分析扩展到对在高效强化学习和自我改进算法中平衡QDC的重要性讨论。类似于训练数据中的QD权衡,模型输出质量与输出多样性之间也常常存在权衡,这会影响合成数据的组成。我们观察到许多模型当前仅针对输出质量进行评估和优化,从而限制了输出多样性以及自我改进的潜力。我们认为平衡这些权衡对于开发未来的自我改进算法至关重要,并指出许多正在本领域取得进展的作品。

关键词

引用

@article{arxiv.2412.02980,
  title  = {Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models},
  author = {Alex Havrilla and Andrew Dai and Laura O'Mahony and Koen Oostermeijer and Vera Zisler and Alon Albalak and Fabrizio Milo and Sharath Chandra Raparthy and Kanishk Gandhi and Baber Abbasi and Duy Phung and Maia Iyer and Dakota Mahan and Chase Blagden and Srishti Gureja and Mohammed Hamdy and Wen-Ding Li and Giovanni Paolini and Pawan Sasanka Ammanamanchi and Elliot Meyerson},
  journal= {arXiv preprint arXiv:2412.02980},
  year   = {2024}
}