中文

面向序列到序列学习的无监督预训练

计算与语言 2018-02-23 v2 机器学习 神经与进化计算

摘要

本工作提出一种通用的无监督学习方法,以提高序列到序列(seq2seq)模型的精度。在我们的方法中,seq2seq 模型的编码器和解码器的权重使用两个语言模型的预训练权重进行初始化,然后利用标注数据微调。我们将该方法应用于机器翻译和生成式摘要中的具有挑战性的基准测试,发现其显著改善了后续的监督模型。我们的主要结果是预训练提升了 seq2seq 模型的泛化能力。我们在 WMT 英\rightarrow德任务上取得了最先进的成果,超越了使用基于短语的机器翻译和神经网络机器翻译的一系列方法。我们的方法在 WMT'14 和 WMT'15 英\rightarrow德任务上比先前最佳模型显著提高了 1.3 BLEU。我们还在生成式摘要上进行了人工评估,发现我们的方法在统计显著意义上优于纯监督学习基线。

关键词

引用

@article{arxiv.1611.02683,
  title  = {Unsupervised Pretraining for Sequence to Sequence Learning},
  author = {Prajit Ramachandran and Peter J. Liu and Quoc V. Le},
  journal= {arXiv preprint arXiv:1611.02683},
  year   = {2018}
}

备注

Updated to accepted EMNLP 2017 version