中文

Verdi:面向双语语料的质量估计与错误检测

计算与语言 2021-09-06 v2 人工智能

摘要

翻译质量估计对于减少机器翻译中的译后编辑工作量以及跨语言语料清洗至关重要。作为一个研究问题,质量估计(QE)旨在不参考黄金译文的情况下,直接估计给定源句与目标句对的翻译质量,并高亮需要修正的词语。在本文中,我们提出 Verdi,一种用于双语语料词级与句级译后编辑工作量估计的新框架。Verdi 采用两个词预测器,以从句子对中提取多样化特征用于后续质量估计,包括一个基于 transformer 的神经机器翻译(NMT)模型和一个预训练跨语言语言模型(XLM)。我们利用双语语料的对称性,并在 NMT 预测器中应用模型级对偶学习,其通过权重共享同时处理原始任务与对偶任务,从而获得比单向 NMT 模型更强的上下文预测能力。借助对偶学习方案,我们进一步设计了一种新特征,可在不依赖源上下文的情况下直接编码已翻译的目标信息。在 WMT20 QE 任务上开展的广泛实验表明,我们的方法击败了该竞赛的冠军,并以较大优势优于其他基线方法。我们进一步利用 Verdi 提供的句级分数清洗平行语料,并观察到在模型性能与训练效率两方面的收益。

关键词

引用

@article{arxiv.2105.14878,
  title  = {Verdi: Quality Estimation and Error Detection for Bilingual Corpora},
  author = {Mingjun Zhao and Haijiang Wu and Di Niu and Zixuan Wang and Xiaoli Wang},
  journal= {arXiv preprint arXiv:2105.14878},
  year   = {2021}
}

备注

Accepted by The Web Conference 2021