语言模型不止用于预训练:快速在线神经噪声信道建模
计算与语言
2020-11-17 v1
摘要
在海量无标注数据上预训练模型已成为提高许多自然语言处理(NLP)任务准确率的有效方法。另一方面,传统机器翻译长期利用无标注数据进行噪声信道建模。近来,同样的思路已被证明能为神经机器翻译带来显著的改进。遗憾的是,使用现代序列到序列模型进行朴素的噪声信道建模比替代方案慢多达一个数量级。我们通过引入高效近似来解决这一问题,使得采用噪声信道方法的推理速度与强集成模型相当,同时提高准确率。我们还表明,噪声信道方法能够在 WMT 罗马尼亚语-英语翻译任务上取得新的最优结果(state of the art),从而超越强预训练结果。
引用
@article{arxiv.2011.07164,
title = {Language Models not just for Pre-training: Fast Online Neural Noisy Channel Modeling},
author = {Shruti Bhosale and Kyra Yee and Sergey Edunov and Michael Auli},
journal= {arXiv preprint arXiv:2011.07164},
year = {2020}
}
备注
Accepted at WMT 2020