利用透明注意力训练更深的神经机器翻译模型
计算与语言
2018-09-06 v2 人工智能
机器学习
摘要
尽管当前最先进的 NMT 模型,如 RNN seq2seq 与 Transformers,拥有大量参数,但相较于用于文本与视觉应用的卷积模型,它们仍较浅。本工作中我们尝试训练显著(2-3 倍)更深的 Transformer 与 Bi-RNN 编码器用于机器翻译。我们提出对注意力机制的一种简单修改,以缓解更深模型的优化困难,并在基准 WMT'14 英德与 WMT'15 捷英任务上针对两种架构取得一致的 0.7-1.1 BLEU 提升。
引用
@article{arxiv.1808.07561,
title = {Training Deeper Neural Machine Translation Models with Transparent Attention},
author = {Ankur Bapna and Mia Xu Chen and Orhan Firat and Yuan Cao and Yonghui Wu},
journal= {arXiv preprint arXiv:1808.07561},
year = {2018}
}
备注
To appear in EMNLP 2018