中文

ELMER:一种用于高效且高质量文本生成的非自回归预训练语言模型

计算与语言 2022-10-31 v2

摘要

我们在预训练语言模型(PLMs)的方法下研究文本生成任务。通常,采用自回归(AR)方法以逐词符的方式生成文本。尽管AR生成有许多优点,它通常面临推理效率低的问题。因此,非自回归(NAR)模型被提出来同时生成所有目标词符。然而,由于输出文本中缺乏词符依赖,NAR模型通常生成质量较低的文本。在本文中,我们提出ELMER:一种用于NAR文本生成的高效且有效的PLM,以在NAR生成过程中显式建模词符依赖。通过利用早退技术,ELMER根据其预测置信度(更置信的词符将在较低层退出)使词符在不同层生成。此外,我们提出一种新的预训练目标——层置换语言建模,通过对序列中每个词符的退出层进行置换来预训练ELMER。在三个文本生成任务上的实验表明,ELMER显著优于NAR模型,并进一步缩小了与AR PLMs的性能差距(例如在XSUM中ELMER(29.92)对比BART(30.61)ROUGE-L),同时实现了超过10倍的推理加速。

关键词

引用

@article{arxiv.2210.13304,
  title  = {ELMER: A Non-Autoregressive Pre-trained Language Model for Efficient and Effective Text Generation},
  author = {Junyi Li and Tianyi Tang and Wayne Xin Zhao and Jian-Yun Nie and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2210.13304},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 main conference (long paper)