基于置信度的双向全局上下文感知神经机器翻译训练框架
计算与语言
2022-03-18 v3 人工智能
摘要
大多数主流的神经机器翻译(NMT)模型仅限于以从左到右的方式仅根据前文词的局部上下文进行预测。尽管许多先前的研究尝试将全局信息融入 NMT 模型,但在如何有效利用双向全局上下文方面仍存在局限。本文提出了一种用于 NMT 的基于置信度的双向全局上下文感知(CBBGCA)训练框架,其中 NMT 模型与一个辅助的条件掩码语言模型(CMLM)联合训练。训练包括两个阶段:(1)多任务联合训练;(2)基于置信度的知识蒸馏。在第一阶段,通过共享编码器参数,NMT 模型额外受到来自包含双向全局上下文的 CMLM 解码器的信号监督。此外,在第二阶段,以 CMLM 为教师,我们通过知识蒸馏进一步有针对性地将双向全局上下文融入 NMT 模型在其预测置信度较低的目标词上。实验结果表明,我们提出的 CBBGCA 训练框架在三个大规模翻译数据集(即 WMT'14 英德、WMT'19 中英和 WMT'14 英法)上分别显著提升了 NMT 模型 +1.02、+1.30 和 +0.57 的 BLEU 分数。
引用
@article{arxiv.2202.13663,
title = {Confidence Based Bidirectional Global Context Aware Training Framework for Neural Machine Translation},
author = {Chulun Zhou and Fandong Meng and Jie Zhou and Min Zhang and Hongji Wang and Jinsong Su},
journal= {arXiv preprint arXiv:2202.13663},
year = {2022}
}
备注
Pre-print version; Accepted at ACL 2022 as a long paper of main conference