感知不确定性的机器翻译评估
计算与语言
2022-03-28 v2 机器学习
摘要
近年来提出了若干基于神经网络的指标来评估机器翻译质量。然而,它们都依赖于点估计,在句子级提供的信息有限。由于这些指标在带有噪声、偏差且稀缺的人类评判上训练,往往导致不可靠的质量预测,情况更为糟糕。本文引入感知不确定性的机器翻译评估,并分析预测质量的可信度。我们将 COMET 框架与两种不确定性估计方法——蒙特卡洛 dropout 和深度集成——相结合,以获得质量分数及置信区间。我们在 QT21 数据集和 WMT20 指标任务(增补了 MQM 标注)的多种语言对上比较了感知不确定性的机器翻译评估方法的性能。我们尝试了不同数量的参考译文,并进一步讨论了无参考的感知不确定性质量估计在标记可能严重的翻译错误方面的有用性。
引用
@article{arxiv.2109.06352,
title = {Uncertainty-Aware Machine Translation Evaluation},
author = {Taisiya Glushkova and Chrysoula Zerva and Ricardo Rei and André F. T. Martins},
journal= {arXiv preprint arXiv:2109.06352},
year = {2022}
}
备注
Findings of EMNLP 2021 v2: corrected typos (esp. Tab 5)