中文

CBSiMT:基于置信度的加权前缀到前缀训练缓解同声机器翻译幻觉

计算与语言 2023-11-08 v1

摘要

同声机器翻译(SiMT)是一项具有挑战性的任务,要求在源句完整可用之前就开始翻译。前缀到前缀框架常被应用于 SiMT,其学习仅使用部分源前缀来预测目标词。然而,由于语言间的词序差异,未对齐的前缀对会使 SiMT 模型遭受严重的幻觉问题,即目标输出不忠实于源输入。此类问题不仅会产生源前缀不支持的目标词,还会在接收到更多源词时阻碍生成正确翻译。在本工作中,我们提出一种基于置信度的同声机器翻译(CBSiMT)框架,该框架利用模型置信度感知幻觉词,并通过加权前缀到前缀训练缓解其负面影响。具体而言,基于模型置信度计算词级和句级权重,并作用于损失函数。我们使用词级权重显式量化生成目标词的忠实度,并采用句级权重减轻具有严重词序差异的句子对模型的干扰。在 MuST-C 英到中以及 WMT15 德到英 SiMT 任务上的实验结果表明,我们的方法能在大多数延迟区间上持续提升翻译质量,在低延迟下最高提升 2 个 BLEU 分数。

关键词

引用

@article{arxiv.2311.03672,
  title  = {CBSiMT: Mitigating Hallucination in Simultaneous Machine Translation with Weighted Prefix-to-Prefix Training},
  author = {Mengge Liu and Wen Zhang and Xiang Li and Yanzhi Tian and Yuhang Guo and Jian Luan and Bin Wang and Shuoying Chen},
  journal= {arXiv preprint arXiv:2311.03672},
  year   = {2023}
}