中文

基于条件双语互信息的神经机器翻译自适应训练

计算与语言 2022-03-08 v1

摘要

基于词元的自适应训练方法通过依据特定统计度量(如词元频率或互信息)对不同目标词元的损失进行重加权,可缓解词元不平衡问题从而改进神经机器翻译。鉴于标准翻译模型是在先前目标上下文的条件下进行预测,我们认为上述统计度量忽略了目标上下文信息,可能为目标词元分配不恰当的权重。一种可能的解决方案是将目标上下文直接纳入这些统计度量,但目标上下文感知的统计计算代价极高,且相应的存储开销不切实际。为解决上述问题,我们提出一种目标上下文感知的度量,称为条件双语互信息(CBMI),它使得为统计度量补充目标上下文信息成为可能。具体而言,我们的 CBMI 可通过分解条件联合分布形式化为翻译模型概率与语言模型概率的对数商。因此 CBMI 可在模型训练过程中高效计算,无需任何预先特定的统计计算和庞大存储开销。此外,我们提出了一种基于词元级和句子级 CBMI 的有效自适应训练方法。在 WMT14 英德和 WMT19 中英任务上的实验结果表明,我们的方法显著优于 Transformer 基线及其他相关方法。

关键词

引用

@article{arxiv.2203.02951,
  title  = {Conditional Bilingual Mutual Information Based Adaptive Training for Neural Machine Translation},
  author = {Songming Zhang and Yijin Liu and Fandong Meng and Yufeng Chen and Jinan Xu and Jian Liu and Jie Zhou},
  journal= {arXiv preprint arXiv:2203.02951},
  year   = {2022}
}

备注

Accepted at ACL 2022 as a long paper of main conference. The code is available at: https://github.com/songmzhang/CBMI