原文还是译文?关于平行数据在翻译质量估计中的使用
计算与语言
2022-12-21 v1
摘要
机器翻译质量估计(QE)是在无人工撰写参考的情况下评估翻译输出的任务。由于人工标注 QE 数据的稀缺,先前工作尝试利用丰富的无标注平行语料,通过伪标签生成额外训练数据。在本文中,我们展示了平行数据与现实 QE 数据之间的显著差距:对于 QE 数据,严格保证源端为原文、目标端为译文(即翻译体);而对于平行数据,其不加区分,翻译体可能出现在源端或目标端。我们比较了不同翻译方向的平行数据在 QE 数据增强中的影响,发现使用平行语料中源端为原文的部分始终优于其目标端为原文的对应部分。此外,由于 WMT 语料缺乏每句平行句的方向信息,我们训练了一个分类器来区分源端原文与目标端原文的双向文本,并分析了它们在风格和领域上的差异。总之,这些发现表明应使用源端原文的平行数据进行 QE 数据增强,与未区分的数据相比,在句子级和词级 QE 任务上分别带来高达 4.0% 和 6.4% 的相对提升。
引用
@article{arxiv.2212.10257,
title = {Original or Translated? On the Use of Parallel Data for Translation Quality Estimation},
author = {Baopu Qiu and Liang Ding and Di Wu and Lin Shang and Yibing Zhan and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.10257},
year = {2022}
}
备注
work in progress