中文

源提示:基于多源异构语料库的语言模型协同预训练

计算与语言 2023-11-17 v1 人工智能

摘要

预训练语言模型(PLM)已确立 NLP 领域的新范式。为获得更强大的 PLM,最流行且成功的方式之一是持续扩大模型规模与预训练语料库。这些大型语料库通常由汇聚多个来源的较小语料库而得,因此日益多样。然而,这些庞大汇聚语料库的副作用仍研究不足。本文揭示了多源异构语料库用于 PLM 预训练的弊端。为实现多样语料上的协同预训练,我们进一步提出源提示(SP),在预训练与微调阶段显式提示模型数据来源。大量实验结果表明,在多样语料上以 SP 预训练的 PLM 在各类下游任务中获显著改进。

关键词

引用

@article{arxiv.2311.09732,
  title  = {Source Prompt: Coordinated Pre-training of Language Models on Diverse Corpora from Multiple Sources},
  author = {Yipei Xu and Dakuan Lu and Jiaqing Liang and Xintao Wang and Yipeng Geng and Yingsi Xin and Hengkui Wu and Ken Chen and ruiji zhang and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2311.09732},
  year   = {2023}
}