低资源语言模型中基于对比解码的合成数据生成
计算与语言
2025-10-10 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 在海量文本数据上进行训练,已引发数据限制可能迅速到达的担忧。一个潜在解决方案是训练于来自 LLM 抽样的合成数据。在本工作中,我们基于这一思路,探讨了对比解码用于生成合成语料的优势。在受控环境下,我们实验性地使用在原始 100 million 词语料库上训练的优质模型与劣质模型之间的相对差异进行抽样。通过放大来自性能更佳模型的信号,我们创建合成语料库并将其与原始训练数据混合。我们的发现表明,训练于合成数据与真实数据的混合物可提升语言建模目标及多项下游任务的性能。特别地,我们发现使用对比解码生成的合成数据对需要更强推理能力的任务有帮助,而传统抽样生成的合成数据在依赖表层语言能力的任务中效果更佳。
引用
@article{arxiv.2510.08245,
title = {Contrastive Decoding for Synthetic Data Generation in Low-Resource Language Modeling},
author = {Jannek Ulm and Kevin Du and Vésteinn Snæbjarnarson},
journal= {arXiv preprint arXiv:2510.08245},
year = {2025}
}
备注
13 pages, 3 figures