论论合成数据在大语言模型后训练中的作用:逆瓶颈视角
人工智能
2025-02-07 v3 计算与语言
机器学习
摘要
由于高质量、特定数据稀缺,合成数据已成为大型语言模型(LLM)后训练任务中的关键资源。尽管已developed various methods to generate synthetic data,但实际效果与理论理解之间仍存在明显差距。为此,我们首先详细建模了常见的合成数据生成过程。基于该建模,我们展示了后训练模型的泛化能力严重取决于从生成模型中获得的信息增益,并从一种新颖的逆瓶颈视角进行分析。此外,我们引入了通过互信息实现的泛化增益(GGMI)的概念,并阐明了泛化增益与信息增益之间的关系。这一分析为合成数据生成提供了理论基础,进一步突显了其与后训练模型泛化能力之间的联系,为理解合成数据生成技术的设计以及后训练过程的优化提供了理解。我们在 https://github.com/ZyGan1999/Towards-a-Theoretical-Understanding-of-Synthetic-Data-in-LLM-Post-Training 开源代码。
引用
@article{arxiv.2410.01720,
title = {Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective},
author = {Zeyu Gan and Yong Liu},
journal= {arXiv preprint arXiv:2410.01720},
year = {2025}
}