中文

预训练者数据训练指南:度量数据时效、领域覆盖、质量与毒性的影响

计算与语言 2023-11-14 v2 机器学习

摘要

预训练是开发高性能语言模型(LM)的初步且基础性步骤。尽管如此,预训练数据设计却严重缺乏文档记录,且常受缺乏实证支持的直觉引导。为此,我们预训练了 28 个 1.5B 参数的仅解码器模型,训练数据经过如下筛选:(1)不同时间采集,(2)采用不同的毒性与质量过滤,(3)具有不同的领域构成。首先,我们量化了预训练数据时效的影响。评估数据与预训练数据间的时间偏移会导致性能下降,且无法通过微调克服。其次,我们探究质量与毒性过滤的影响,揭示了标准基准性能与有毒生成风险之间的权衡。我们的发现表明,在过滤训练数据方面不存在一刀切的解决方案。我们还发现,不同类型过滤的效果无法从文本领域特征中预测。最后,我们实证验证了纳入书籍与网络等异构数据源具有广泛益处,值得更高优先级的考量。这些发现构成了规模最大的实验集合,用以验证、量化并揭示诸多关于文本预训练未记录的直觉,我们希望其能助力 LM 开发中更明智的数据中心决策。

关键词

引用

@article{arxiv.2305.13169,
  title  = {A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity},
  author = {Shayne Longpre and Gregory Yauney and Emily Reif and Katherine Lee and Adam Roberts and Barret Zoph and Denny Zhou and Jason Wei and Kevin Robinson and David Mimno and Daphne Ippolito},
  journal= {arXiv preprint arXiv:2305.13169},
  year   = {2023}
}