按下正确的按钮:质量估计的对抗性评估
计算与语言
2021-09-23 v1 人工智能
摘要
当前机器翻译(MT)系统在日益增长的语言对与数据集上取得了非常好的结果。然而,已知它们会产生流畅但可能包含重要语义错误的翻译输出,从而削弱其在实际中的可靠性。质量估计(QE)是在测试时自动评估MT系统性能的任务。因此,为具备实用性,QE系统应能够检测此类错误。然而,在当前仅以与人类判断的相关性来评估QE系统的评测实践中,这一能力尚待检验。本工作中,我们弥合此差距,提出一种针对MT的QE对抗测试通用方法论。首先,我们表明尽管近期SOTA取得了与人类判断的高相关性,某些类型的语义错误仍令QE难以检测。其次,我们表明平均而言,给定模型区分语义保持与语义改变扰动的能力可预测其整体性能,从而潜在地允许在不依赖人工质量标注的情况下比较QE系统。
引用
@article{arxiv.2109.10859,
title = {Pushing the Right Buttons: Adversarial Evaluation of Quality Estimation},
author = {Diptesh Kanojia and Marina Fomicheva and Tharindu Ranasinghe and Frédéric Blain and Constantin Orăsan and Lucia Specia},
journal= {arXiv preprint arXiv:2109.10859},
year = {2021}
}
备注
Accepted to WMT 2021 Conference co-located with EMNLP 2021. 14 pages with a 4 page appendix