中文

衡量 Web 过滤文本数据集的指纹及其在训练中的传播

机器学习 2025-12-02 v3

摘要

我们通过数据集分类实验探讨大型语言模型 (LLM) 预训练数据集中的指纹。建立在先前研究表明流行计算机视觉数据集存在指纹或偏差的基础上,我们分析了来自 CommonCrawl 的众多开源预训练数据集,包括 C4、RefinedWeb、DolmaCC、RedPajama-V2、FineWeb 和 DCLM-Baseline。尽管这些数据集采用了相似的筛选步骤,神经网络仍能相当准确地分类单个文本序列属于哪个数据集,优于人类水平。这表明筛选和处理流程中的细微差异会产生指纹。这些指纹体现在格式、词汇和内容分布上,并可能对跨数据集泛化造成负面影响。此外,我们展示了这些指纹会随着训练传播:由这些数据集训练的模型生成的序列,仍可被在原始数据集上训练的分类器准确分类。这为洞悉 LLM 开发者通常不披露的数据特征提供了洞见,包括预训练混合比例和微调数据来源。

关键词

引用

@article{arxiv.2412.02857,
  title  = {Measuring Fingerprints of Web-filtered Text Datasets and Fingerprint Propagation Through Training},
  author = {Youssef Mansour and Reinhard Heckel},
  journal= {arXiv preprint arXiv:2412.02857},
  year   = {2025}
}