寄存器始终重要:通过语言变体视角分析大语言模型的预训练数据
计算与语言
2026-05-25 v2
摘要
预训练数据筛选是大型语言模型 (LLM) 开发的基石,导致相关研究增长,对大型网络语料库进行质量过滤。从统计质量标记到基于 LLM 的标注系统,数据集被划分为类别,常常简化为二元:通过筛选的数据被视为有价值的示例,其他数据则被视为无用或有害。然而,不同类型文本对模型性能贡献的更详细理解仍在很大程度上缺乏。本文首次利用寄存器或语种——语料库语言学中用于建模语言变体的标准方法——来筛选预训练数据集并研究寄存器对大语言模型性能的影响。我们使用寄存器分类的数据训练小型生成式模型,并通过标准基准测试进行评估,表明预训练数据的寄存器对模型性能具有显著影响。我们发现,预训练材料与所得模型之间存在令人惊讶的关系:使用新闻寄存器会导致性能下降,相反,包括意见类别(覆盖评论和意见博客等文本)的训练对模型性能提升极大。虽然基于整个未经筛选数据集训练的模型在性能上优于仅限单一寄存器的数据集训练的模型,但将表现良好的寄存器组合,如 How-to-Instructions、Informational Description 和 Opinion 等,能带来显著的性能提升。此外,对单个基准结果的分析揭示了特定寄存器类别作为预训练数据的优势与缺陷之间的关键差异。这些发现表明,寄存器是解释模型变异且可促进更为审慎的数据选择实践的重要因素。
引用
@article{arxiv.2504.01542,
title = {Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation},
author = {Amanda Myntti and Erik Henriksson and Veronika Laippala and Sampo Pyysalo},
journal= {arXiv preprint arXiv:2504.01542},
year = {2026}
}