PreQuEL:提前估计机器翻译输出的质量
计算与语言
2022-12-06 v2 机器学习
摘要
我们提出 PreQuEL 任务,即预质量估计(Pre-(Quality-Estimation))学习。PreQuEL 系统预测给定句子将被翻译得多好,而无需借助实际译文,从而在翻译质量必然较低时避免不必要的资源分配。PreQuEL 可相对于给定 MT 系统(例如某些工业服务)定义,或一般地相对于最先进水平定义。从理论角度看,PreQuEL 将焦点置于源文本,追踪使句子更难机器翻译的属性,可能是语言特征。我们为该任务开发了基线模型并分析其性能。我们还开发了(基于平行语料库的)数据增强方法,大幅改进了结果。我们表明该增强方法也能改进质量估计(Quality-Estimation)任务的性能。我们通过挑战集与不同语言测试模型,考察输入文本中模型所敏感的性质。我们得出结论:它感知句法与语义区别,并与标准 NLP 特征的重要性相关甚至过度强调之。
引用
@article{arxiv.2205.09178,
title = {PreQuEL: Quality Estimation of Machine Translation Outputs in Advance},
author = {Shachar Don-Yehiya and Leshem Choshen and Omri Abend},
journal= {arXiv preprint arXiv:2205.09178},
year = {2022}
}
备注
Accepted to the main conference of EMNLP 2022