加速神经机器翻译中的异步随机梯度下降
计算与语言
2018-09-17 v2
摘要
为了从异步随机梯度下降中提取最佳性能,必须增大小批量尺寸并相应地缩放学习率。为了实现进一步的加速,我们引入了一种延迟梯度更新的技术,有效地增大了小批量尺寸。遗憾的是,随着小批量尺寸的增大,我们加剧了异步随机梯度下降(SGD)中的陈旧梯度问题,这使得模型收敛变差。我们引入了局部优化器来缓解陈旧梯度问题,并结合对动量的精细调节,能够以可忽略的 BLEU 损失比优化后的基线快 27% 训练一个浅层机器翻译系统。
引用
@article{arxiv.1808.08859,
title = {Accelerating Asynchronous Stochastic Gradient Descent for Neural Machine Translation},
author = {Nikolay Bogoychev and Marcin Junczys-Dowmunt and Kenneth Heafield and Alham Fikri Aji},
journal= {arXiv preprint arXiv:1808.08859},
year = {2018}
}
备注
To appear in EMNLP 2018 as a short paper