利用预训练检查点处理序列生成任务
计算与语言
2022-08-10 v2
摘要
大型神经模型的无监督预训练近来彻底改变了自然语言处理。通过从公开发布的检查点进行热启动,NLP 从业者已在多个基准上推进了最优性能,并节省了大量计算时间。迄今为止,焦点主要集中自然语言理解任务上。在本文中,我们展示了预训练检查点对序列生成的有效性。我们开发了一个基于 Transformer 的序列到序列模型,该模型与公开可用的预训练 BERT、GPT-2 和 RoBERTa 检查点兼容,并就使用这些检查点(包括编码器和解码器)初始化我们模型的效用进行了广泛的实证研究。我们的模型在机器翻译、文本摘要、句子拆分和句子融合任务上取得了新的最优结果。
引用
@article{arxiv.1907.12461,
title = {Leveraging Pre-trained Checkpoints for Sequence Generation Tasks},
author = {Sascha Rothe and Shashi Narayan and Aliaksei Severyn},
journal= {arXiv preprint arXiv:1907.12461},
year = {2022}
}
备注
To be published in Transactions of the Association for Computational Linguistics (TACL)