Cold Fusion:将Seq2Seq模型与语言模型联合训练
计算与语言
2017-08-23 v1
摘要
带有注意力机制的序列到序列(Seq2Seq)模型在涉及生成自然语言句子的任务中表现优异,例如机器翻译、图像描述生成和语音识别。通过利用无标签数据(通常以语言模型的形式),性能得到了进一步提升。在本工作中,我们提出了 Cold Fusion 方法,在训练期间利用预训练的语言模型,并展示了其在语音识别任务上的有效性。我们表明,采用 Cold Fusion 的 Seq2Seq 模型能够更好地利用语言信息,具有: 更快的收敛速度和更好的泛化能力; 在使用不到 10% 的标注训练数据的情况下,几乎完全迁移到新领域。
关键词
引用
@article{arxiv.1708.06426,
title = {Cold Fusion: Training Seq2Seq Models Together with Language Models},
author = {Anuroop Sriram and Heewoo Jun and Sanjeev Satheesh and Adam Coates},
journal= {arXiv preprint arXiv:1708.06426},
year = {2017}
}