扩展神经机器翻译的规模
计算与语言
2018-09-06 v3
摘要
序列到序列学习模型在单台机器上使用大型基准数据集达到最先进性能仍需要数天时间。本文表明,通过精细调优与实现,降低精度与大规模批量训练可在单台 8-GPU 机器上将训练加速近 5 倍。在 WMT'14 英德翻译上,我们在 8 块 GPU 上训练不到 5 小时即匹配了 Vaswani 等人 (2017) 的精度,并在 128 块 GPU 上训练 85 分钟后获得了 29.3 BLEU 的新最先进水平。我们通过在更大的 Paracrawl 数据集上训练将这些结果进一步提升至 29.8 BLEU。在 WMT'14 英法任务上,我们在 128 块 GPU 上以 8.5 小时获得了 43.2 BLEU 的最先进结果。
引用
@article{arxiv.1806.00187,
title = {Scaling Neural Machine Translation},
author = {Myle Ott and Sergey Edunov and David Grangier and Michael Auli},
journal= {arXiv preprint arXiv:1806.00187},
year = {2018}
}
备注
WMT 2018