中文

利用透明注意力训练更深的神经机器翻译模型

计算与语言 2018-09-06 v2 人工智能 机器学习

摘要

尽管当前最先进的 NMT 模型,如 RNN seq2seq 与 Transformers,拥有大量参数,但相较于用于文本与视觉应用的卷积模型,它们仍较浅。本工作中我们尝试训练显著(2-3 倍)更深的 Transformer 与 Bi-RNN 编码器用于机器翻译。我们提出对注意力机制的一种简单修改,以缓解更深模型的优化困难,并在基准 WMT'14 英德与 WMT'15 捷英任务上针对两种架构取得一致的 0.7-1.1 BLEU 提升。

关键词

引用

@article{arxiv.1808.07561,
  title  = {Training Deeper Neural Machine Translation Models with Transparent Attention},
  author = {Ankur Bapna and Mia Xu Chen and Orhan Firat and Yuan Cao and Yonghui Wu},
  journal= {arXiv preprint arXiv:1808.07561},
  year   = {2018}
}

备注

To appear in EMNLP 2018