中文

GPU 架构上神经机器翻译的超参数优化探索

计算与语言 2021-09-15 v2

摘要

由于诸如 FPGA 和 GPU 等商用异构计算架构的丰富性与可编程性,以及来自新闻机构、政府机构和社交媒体产生的大量训练语料,神经机器翻译(NMT)相比基于统计的方法已被深度学习神经网络所加速。训练神经网络的分类器需要调整能产出最佳性能的超参数。不幸的是,机器翻译的参数数量包含离散类别以及连续选项,这构成了一个组合爆炸问题。本研究探索在训练深度学习神经网络用于机器翻译时优化超参数。具体而言,我们的工作研究了用 Marian NMT 训练语言模型。结果比较了在单节点和多节点设置下多种现代 GPU 架构代际中不同超参数设置的 NMT,揭示了关于哪些超参数在性能(如每秒处理词数、收敛率和翻译准确率)方面最为重要的见解,并提供了如何最佳地实现高性能 NMT 系统的见解。

关键词

引用

@article{arxiv.1805.02094,
  title  = {Exploring Hyper-Parameter Optimization for Neural Machine Translation on GPU Architectures},
  author = {Robert Lim and Kenneth Heafield and Hieu Hoang and Mark Briers and Allen Malony},
  journal= {arXiv preprint arXiv:1805.02094},
  year   = {2021}
}

备注

2018 2nd Naval Applications for Machine Learning