基于扰动的 QE:一种可解释、无监督的词级黑盒机器翻译质量估计方法
计算与语言
2023-07-14 v2
摘要
质量估计(QE)是在不使用任何黄金标准译文参考的情况下,预测机器翻译(MT)系统输出质量的任务。最先进的 QE 模型是有监督的:它们需要某些数据集上某些 MT 系统输出的人工标注质量用于训练,使其依赖于领域和 MT 系统。已有关于无监督 QE 的研究,其需要玻璃盒访问 MT 系统,或需要平行 MT 数据来生成合成错误以训练 QE 模型。在本文中,我们提出基于扰动的 QE——一种仅通过分析扰动输入源句子上的 MT 系统输出来工作的词级质量估计方法。我们的方法无监督、可解释,并且可以评估任何类型的黑盒 MT 系统,包括当前具有不透明内部过程的大语言模型(LLMs)。对于没有标注 QE 数据的语言方向,我们的方法在 WMT21 共享任务上的性能与零样本有监督方法相似或更好。我们的方法在检测翻译中的性别偏见和词义消歧错误方面优于有监督 QE,表明其对域外使用的鲁棒性。在检测非传统翻译提示 LLM 上的错误时性能差距更大,表明我们的方法对不同 MT 系统更具泛化性。我们给出示例展示我们方法的可解释性能力,其显示哪些输入源词对某个 MT 输出词有影响。
引用
@article{arxiv.2305.07457,
title = {Perturbation-based QE: An Explainable, Unsupervised Word-level Quality Estimation Method for Blackbox Machine Translation},
author = {Tu Anh Dinh and Jan Niehues},
journal= {arXiv preprint arXiv:2305.07457},
year = {2023}
}
备注
Accepted to MT Summit 2023