中文

用于非自回归机器翻译的顺序无关交叉熵

计算与语言 2021-06-10 v1 人工智能 机器学习

摘要

我们提出了一种用于全非自回归翻译(NAT)模型的名为顺序无关交叉熵(OaXE)的新训练目标。OaXE 改进了标准交叉熵损失,以缓解词重排序的影响,而词重排序是 NAT 中关键多模态问题的常见来源。具体而言,OaXE 去除了对词序错误的惩罚,并基于模型预测与目标词元之间的最佳可能对齐来计算交叉熵损失。由于对数损失对无效参考非常敏感,我们利用交叉熵初始化和损失截断来确保模型聚焦于搜索空间的良好部分。在主要 WMT 基准上的大量实验表明,OaXE 显著提升了翻译性能,为全 NAT 模型确立了新的最优结果(SOTA)。进一步的分析表明,OaXE 通过减少词元重复和增加预测置信度来缓解多模态问题。我们的代码、数据和训练模型可在 https://github.com/tencent-ailab/ICML21_OAXE 获取。

关键词

引用

@article{arxiv.2106.05093,
  title  = {Order-Agnostic Cross Entropy for Non-Autoregressive Machine Translation},
  author = {Cunxiao Du and Zhaopeng Tu and Jing Jiang},
  journal= {arXiv preprint arXiv:2106.05093},
  year   = {2021}
}

备注

ICML 2021 (Oral), Code at https://github.com/tencent-ailab/ICML21_OAXE