中文

Diformer:用于神经机器翻译的方向性 Transformer

计算与语言 2022-01-03 v2 人工智能

摘要

自回归(AR)与非自回归(NAR)模型在性能与延迟上各有优势,将二者结合为单一模型或可兼取所长。当前的结合框架更侧重于通过统一生成模型(如掩码语言模型)整合多种解码范式。然而,由于训练目标与推理之间的差距,这种泛化可能损害性能。本文旨在统一框架下保留 AR 与 NAR 的原始目标以缩小该差距。具体而言,我们提出方向性 Transformer(Diformer),通过新引入的方向变量将 AR 与 NAR 联合建模为三种生成方向(从左至右、从右至左和直通),该变量通过控制每个词元的预测在该方向下具有特定依赖关系来发挥作用。由方向实现的统一成功保留了 AR 与 NAR 中使用的原始依赖假设,兼顾泛化与性能。在 4 个 WMT 基准上的实验表明,Diformer 在 AR 与 NAR 解码上均以超过 1.5 个 BLEU 点的优势优于当前的统一建模工作,并且与最先进的独立 AR 和 NAR 模型相比也具有竞争力。

关键词

引用

@article{arxiv.2112.11632,
  title  = {Diformer: Directional Transformer for Neural Machine Translation},
  author = {Minghan Wang and Jiaxin Guo and Yuxia Wang and Daimeng Wei and Hengchao Shang and Chang Su and Yimeng Chen and Yinglu Li and Min Zhang and Shimin Tao and Hao Yang},
  journal= {arXiv preprint arXiv:2112.11632},
  year   = {2022}
}