面向预训练数据增强的重构方法
计算与语言
2025-05-20 v2
摘要
尽管大型语言模型在各种任务中展现出令人印象深刻的能力,但其持续扩展不仅受到数据稀缺的严重阻碍,还受到训练过程中过度数据重复所导致的性能下降的影响。为了克服这一关键瓶颈,我们提出了大规模体裁-受众重构方法,这是一种受合成数据方法论启发的轻量级且可扩展的数据增强技术。大规模体裁-受众重构方法系统地将现有语料库重构为多样化、上下文丰富的变体,以减轻重复的负面影响,我们在此工作中介绍了该方法及其产生的 7700 亿词元的大规模体裁-受众语料库。我们通过在扩展场景(高达 130 亿参数)中展示其相对于数据重复和上采样的优越性能,实验性地验证了其核心优势。此外,全面的分析探讨了提示工程在生成质量中的作用,并揭示了使用标准损失指标评估模型能力时的细微差别。我们的工作表明,大规模体裁-受众重构方法为大幅扩充训练数据集提供了一条可靠的途径,有效缓解了重复瓶颈,并使大型语言模型能够更高效地扩展。
引用
@article{arxiv.2502.04235,
title = {Reformulation for Pretraining Data Augmentation},
author = {Xintong Hao and Ruijie Zhu and Ge Zhang and Ke Shen and Chenggang Li},
journal= {arXiv preprint arXiv:2502.04235},
year = {2025}
}
备注
Dataset released https://huggingface.co/datasets/ByteDance-Seed/mga-fineweb-edu