神经机器翻译架构的大规模探索
计算与语言
2017-03-23 v2
摘要
神经机器翻译(Neural Machine Translation, NMT)在过去几年中取得了显著进展,目前已有生产系统部署给终端用户。当前架构的一个主要缺点是训练成本高昂,通常需要数天到数周的 GPU 时间才能收敛。这使得在其他神经网络架构中常见的穷举式超参数搜索变得代价过高而难以承受。在这项工作中,我们首次对 NMT 架构超参数进行了大规模分析。我们报告了数百次实验运行的实证结果和方差数据,这些实验对应于标准 WMT 英语到德语翻译任务上超过 250,000 GPU 小时的计算量。我们的实验为构建和扩展 NMT 架构带来了新颖的见解和实用的建议。作为这项贡献的一部分,我们发布了一个开源的 NMT 框架,使研究人员能够轻松地试验新技术并复现最先进的结果。
引用
@article{arxiv.1703.03906,
title = {Massive Exploration of Neural Machine Translation Architectures},
author = {Denny Britz and Anna Goldie and Minh-Thang Luong and Quoc Le},
journal= {arXiv preprint arXiv:1703.03906},
year = {2017}
}
备注
9 pages, 2 figures, 8 tables, submitted to ACL 2017, open source code at https://github.com/google/seq2seq/