GPU 架构上神经机器翻译的超参数优化探索
计算与语言
2021-09-15 v2
摘要
由于诸如 FPGA 和 GPU 等商用异构计算架构的丰富性与可编程性,以及来自新闻机构、政府机构和社交媒体产生的大量训练语料,神经机器翻译(NMT)相比基于统计的方法已被深度学习神经网络所加速。训练神经网络的分类器需要调整能产出最佳性能的超参数。不幸的是,机器翻译的参数数量包含离散类别以及连续选项,这构成了一个组合爆炸问题。本研究探索在训练深度学习神经网络用于机器翻译时优化超参数。具体而言,我们的工作研究了用 Marian NMT 训练语言模型。结果比较了在单节点和多节点设置下多种现代 GPU 架构代际中不同超参数设置的 NMT,揭示了关于哪些超参数在性能(如每秒处理词数、收敛率和翻译准确率)方面最为重要的见解,并提供了如何最佳地实现高性能 NMT 系统的见解。
引用
@article{arxiv.1805.02094,
title = {Exploring Hyper-Parameter Optimization for Neural Machine Translation on GPU Architectures},
author = {Robert Lim and Kenneth Heafield and Hieu Hoang and Mark Briers and Allen Malony},
journal= {arXiv preprint arXiv:1805.02094},
year = {2021}
}
备注
2018 2nd Naval Applications for Machine Learning