中文

加速神经机器翻译中的异步随机梯度下降

计算与语言 2018-09-17 v2

摘要

为了从异步随机梯度下降中提取最佳性能,必须增大小批量尺寸并相应地缩放学习率。为了实现进一步的加速,我们引入了一种延迟梯度更新的技术,有效地增大了小批量尺寸。遗憾的是,随着小批量尺寸的增大,我们加剧了异步随机梯度下降(SGD)中的陈旧梯度问题,这使得模型收敛变差。我们引入了局部优化器来缓解陈旧梯度问题,并结合对动量的精细调节,能够以可忽略的 BLEU 损失比优化后的基线快 27% 训练一个浅层机器翻译系统。

关键词

引用

@article{arxiv.1808.08859,
  title  = {Accelerating Asynchronous Stochastic Gradient Descent for Neural Machine Translation},
  author = {Nikolay Bogoychev and Marcin Junczys-Dowmunt and Kenneth Heafield and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:1808.08859},
  year   = {2018}
}

备注

To appear in EMNLP 2018 as a short paper