从人类判断重新审视机器翻译的词级质量估计
计算与语言
2022-09-14 v1
摘要
机器翻译(MT)的词级质量估计(QE)旨在无参考的情况下找出译句中潜在的翻译错误。通常,词级 QE 的传统工作被设计为根据译后编辑工作量预测翻译质量,其中词标签(“OK”和“BAD”)是通过 TER (Translation Error Rate) 工具包比较 MT 句子与译后编辑句子的词来自动生成的。尽管译后编辑工作量在某种程度上可用于衡量翻译质量,我们发现它通常与人类关于该词翻译好坏的判断相冲突。为克服该局限,我们首先创建了一个黄金基准数据集,即 \emph{HJQE}(人类判断质量估计),其中专家译员直接根据其判断标注翻译较差的词。此外,为进一步利用平行语料库,我们提出具有两种标签纠正策略的自监督预训练,即标签精炼策略和基于树的标注策略,以使基于 TER 的人工 QE 语料库更接近 \emph{HJQE}。我们基于公开可用的 WMT En-De 和 En-Zh 语料库进行了大量实验。结果不仅表明我们提出的数据集更符合人类判断,也证实了所提标签纠正策略的有效性。\footnote{数据可在 \url{https://github.com/ZhenYangIACAS/HJQE} 找到。}
引用
@article{arxiv.2209.05695,
title = {Rethink about the Word-level Quality Estimation for Machine Translation from Human Judgement},
author = {Zhen Yang and Fandong Meng and Yuanmeng Yan and Jie Zhou},
journal= {arXiv preprint arXiv:2209.05695},
year = {2022}
}
备注
8 pages, 6 figures