中文

ELLE:面向新兴数据的高效终身预训练

计算与语言 2022-07-12 v2 人工智能

摘要

当前的预训练语言模型(PLM)通常使用静态数据训练,忽略了在真实场景中,来自多种来源的流式数据可能持续增长。这要求PLM以终身方式整合所有来源的信息。尽管这一目标可通过在所有现有数据上进行穷尽预训练来实现,但已知该过程计算代价高昂。为此,我们提出ELLE,旨在面向新兴数据的高效终身预训练。具体而言,ELLE包含(1)函数保持的模型扩展,灵活扩展现有PLM的宽度和深度以提高知识获取效率;以及(2)预训练领域提示,解耦预训练期间学习的通用知识并为下游任务激发恰当知识。我们在BERT和GPT上以来自5个领域的流式数据对ELLE进行实验。结果表明,在预训练效率和下游性能方面,ELLE优于多种终身学习基线。代码已公开于 https://github.com/thunlp/ELLE。

关键词

引用

@article{arxiv.2203.06311,
  title  = {ELLE: Efficient Lifelong Pre-training for Emerging Data},
  author = {Yujia Qin and Jiajie Zhang and Yankai Lin and Zhiyuan Liu and Peng Li and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2203.06311},
  year   = {2022}
}

备注

Findings of ACL 2022