中文

利用预训练检查点处理序列生成任务

计算与语言 2022-08-10 v2

摘要

大型神经模型的无监督预训练近来彻底改变了自然语言处理。通过从公开发布的检查点进行热启动,NLP 从业者已在多个基准上推进了最优性能,并节省了大量计算时间。迄今为止,焦点主要集中自然语言理解任务上。在本文中,我们展示了预训练检查点对序列生成的有效性。我们开发了一个基于 Transformer 的序列到序列模型,该模型与公开可用的预训练 BERT、GPT-2 和 RoBERTa 检查点兼容,并就使用这些检查点(包括编码器和解码器)初始化我们模型的效用进行了广泛的实证研究。我们的模型在机器翻译、文本摘要、句子拆分和句子融合任务上取得了新的最优结果。

关键词

引用

@article{arxiv.1907.12461,
  title  = {Leveraging Pre-trained Checkpoints for Sequence Generation Tasks},
  author = {Sascha Rothe and Shashi Narayan and Aliaksei Severyn},
  journal= {arXiv preprint arXiv:1907.12461},
  year   = {2022}
}

备注

To be published in Transactions of the Association for Computational Linguistics (TACL)