中文

从人类判断重新审视机器翻译的词级质量估计

计算与语言 2022-09-14 v1

摘要

机器翻译(MT)的词级质量估计(QE)旨在无参考的情况下找出译句中潜在的翻译错误。通常,词级 QE 的传统工作被设计为根据译后编辑工作量预测翻译质量,其中词标签(“OK”和“BAD”)是通过 TER (Translation Error Rate) 工具包比较 MT 句子与译后编辑句子的词来自动生成的。尽管译后编辑工作量在某种程度上可用于衡量翻译质量,我们发现它通常与人类关于该词翻译好坏的判断相冲突。为克服该局限,我们首先创建了一个黄金基准数据集,即 \emph{HJQE}(人类判断质量估计),其中专家译员直接根据其判断标注翻译较差的词。此外,为进一步利用平行语料库,我们提出具有两种标签纠正策略的自监督预训练,即标签精炼策略和基于树的标注策略,以使基于 TER 的人工 QE 语料库更接近 \emph{HJQE}。我们基于公开可用的 WMT En-De 和 En-Zh 语料库进行了大量实验。结果不仅表明我们提出的数据集更符合人类判断,也证实了所提标签纠正策略的有效性。\footnote{数据可在 \url{https://github.com/ZhenYangIACAS/HJQE} 找到。}

关键词

引用

@article{arxiv.2209.05695,
  title  = {Rethink about the Word-level Quality Estimation for Machine Translation from Human Judgement},
  author = {Zhen Yang and Fandong Meng and Yuanmeng Yan and Jie Zhou},
  journal= {arXiv preprint arXiv:2209.05695},
  year   = {2022}
}

备注

8 pages, 6 figures