中文

DecorateLM:通过语料评估、标记与编辑进行数据工程

计算与语言 2024-10-11 v1

摘要

大型语言模型(LLM)的性能在很大程度上取决于预训练语料,该语料由大量无监督数据构成,由模型进行处理。尽管该数据在模型性能中发挥着关键作用,但由于数据规模庞大且缺乏样本级别的质量标注和增强,确保其质量仍具有挑战性。本文介绍了 DecorateLM,这是一种旨在通过数据评估、标记和编辑来完善预训练语料的数据工程方法。具体而言,DecorateLM 对文本依据质量标准进行评分、添加层次化标签,并将文本编辑为更规范的格式。由于预训练语料的规模庞大,使用 LLM 对整个语料进行装饰效率较低。因此,为在性能与效率之间取得平衡,我们构建了一个经过精细标注的训练语料库,用于训练 DecorateLM,同时将数据工程知识蒸馊到一个规模仅为 10 亿参数的小型语言模型(SLM)。随后我们应用 DecorateLM 来提升 1000亿token 预训练语料的质量,筛选出 450亿token 作为用于进一步训练另一个 10亿参数 LLM 的高质量且多样性良好的样本。我们的结果表明,使用如此高质量的数据可以显著提升模型性能,展示了一种强大的数据预训练语料质量提升方法。

关键词

引用

@article{arxiv.2410.05639,
  title  = {DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models},
  author = {Ranchi Zhao and Zhen Leng Thai and Yifan Zhang and Shengding Hu and Yunqi Ba and Jie Zhou and Jie Cai and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2410.05639},
  year   = {2024}
}