机器翻译句子级置信度估计中的数据问题
计算与语言
2020-10-28 v1 机器学习
摘要
本文研究了处于性能高段的神经机器翻译模型的置信度估计可行性。作为构建此类模型所需数据标注过程的副产品,我们提出句子级准确率 作为一种简单、自解释的翻译质量评估指标。基于两个不同标注者群体(一个由非专家(众包)组成,另一个由专家(职业)翻译组成)的实验表明,尽管根据 Krippendorff's alpha 指标两个群体可靠性大致相当,但 会因标注者的翻译熟练度而大幅变化;相对较低的标注者间一致性数值证实了以下预期:脱离上下文对翻译进行句子级二值标注 / 是非常困难的。对于一个根据非专家标注者群体测得 的英西翻译模型,我们可以推导出一个置信度估计,该估计在以 0.95 准确率(Precision)在“领域内”测试集中标注 0.5-0.6 的 翻译。切换到专家标注者群体后 急剧下降:英西翻译为 ,测量于与上述完全相同的数据。这迫使我们降低 CE 模型工作点至 0.9 Precision,同时在数据中正确标注约 0.20-0.25 的 翻译。我们发现 CE 对用于数据标注的标注者群体熟练程度的依赖程度令人惊讶。这引出了我们在实践中处理 CE 建模时要提出的重要建议:将目标领域中终端用户对翻译质量的期望与向 CE 训练数据分配二值质量标签的标注者要求相匹配至关重要。
引用
@article{arxiv.2010.13856,
title = {Data Troubles in Sentence Level Confidence Estimation for Machine Translation},
author = {Ciprian Chelba and Junpei Zhou and Yuezhang and Li and Hideto Kazawa and Jeff Klingner and Mengmeng Niu},
journal= {arXiv preprint arXiv:2010.13856},
year = {2020}
}