中文

我们真的必须过滤掉预训练数据中的随机噪声吗?

计算与语言 2025-05-19 v2

摘要

Web 规模的预训练数据是大语言模型成功的基石。然而,来自互联网的文本数据不可避免地包含由解码错误或不受监管的网络内容引起的随机噪声。与之前关注低质量或人造数据的研究不同,本研究提供了对此类随机噪声的系统性调查,通过一个连贯的“What-Why-How”框架。令人惊讶的是,即使模型规模扩展到 27 亿参数,我们观察到的下一个标记预测(NTP)损失的增加显著低于随机噪声的比例。我们提供了对这一现象的理论依据,这也阐明了多语言模型的成功,并可应用于多模态模型。另一方面,实验表明,模型在下游任务中的性能并不仅仅基于 NTP 损失,这意味着随机噪声可能导致下游任务性能下降。为了解决潜在的负面影响,我们引入一种新的插拔式 Local Gradient Matching 损失,通过在不要求模型参数知识的情况下,对正常特征和扰动特征的梯度进行对齐,显式增强了下游任务头的去噪能力。额外的在 8 个语言和 14 个视觉基准测试上的实验进一步验证了其有效性。

关键词

引用

@article{arxiv.2502.06604,
  title  = {Do we really have to filter out random noise in pre-training data for language models?},
  author = {Jinghan Ru and Yuxin Xie and Xianwei Zhuang and Yuguo Yin and Zhihui Guo and Zhiming Liu and Qianli Ren and Yuexian Zou},
  journal= {arXiv preprint arXiv:2502.06604},
  year   = {2025}
}