中文

合成继续预训练

机器学习 2024-10-04 v2 人工智能 计算与语言 机器学习

摘要

大规模非结构化互联网文本的预训练使语言模型能够获取大量世界知识。然而,这种知识获取数据效率较低--模型必须在数百至数千种多样化的表述上进行训练才能学习到给定事实。这在针对小型特定领域文档 Corpus 进行模型微调时提出挑战,因为每个事实可能只出现一次或很少出现。我们提出通过合成继续预训练来弥合这一差距:使用小型特定领域 Corpus 来合成更适合学习的大型 Corpus,然后在合成 Corpus 上进行继续预训练。我们以 EntiGraph 为实现方案,该算法从源文档中提取关键实体,然后通过在抽样实体之间建立联系来生成多样化文本。使用 EntiGraph 的合成继续预训练使语言模型能够在获取的知识用于回答与源文档相关的问题和遵循通用指令方面发挥作用,而无需直接访问这些文档。若在推理时可获取源文档,我们进一步表明通过本方法获取的知识可与检索增强生成相结合。为更好地理解这些结果,我们构建了一个简单的数学模型来说明合成数据增强如何“重新排列”知识以实现更数据高效的学习。

关键词

引用

@article{arxiv.2409.07431,
  title  = {Synthetic continued pretraining},
  author = {Zitong Yang and Neil Band and Shuangping Li and Emmanuel Candès and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2409.07431},
  year   = {2024}
}

备注

Updated organization of experimental results and methods introduction. Released the dataset and model weights artifact