机器翻译系统的定量细粒度人工评估:以英语到克罗地亚语为例
计算与语言
2018-02-13 v1 人工智能
摘要
本文提出一种定量细粒度的手动评估方法,用于比较不同机器翻译(MT)系统的性能。我们基于成熟的多维质量指标(MQM)错误分类体系,实现了一种新方法,用于评估不同 MT 系统之间在 MQM 错误类型上的性能差异是否具有统计显著性。我们以英语到克罗地亚语这一涉及向形态丰富语言翻译的语言方向为案例进行研究,比较了属于不同范式的三个 MT 系统:纯基于短语的、基于因子化的短语的和神经的。首先,我们设计了一套符合 MQM、针对斯拉夫语言相关语言现象定制的错误分类体系,使标注过程可行且准确。随后,两名标注者依据该分类体系对 MT 输出中的错误进行标注。接着,我们进行了统计分析,结果表明表现最好的系统(神经的)将表现最差系统(纯基于短语的)产生的错误减少了逾一半(54%)。此外,我们对一致错误进行了额外分析,区分了短距离(短语级)和长距离(句子级)错误。我们发现基于短语的 MT 方法对长距离一致现象作用有限,而神经 MT 对此尤为有效。
引用
@article{arxiv.1802.01451,
title = {Quantitative Fine-Grained Human Evaluation of Machine Translation Systems: a Case Study on English to Croatian},
author = {Filip Klubička and Antonio Toral and Víctor M. Sánchez-Cartagena},
journal= {arXiv preprint arXiv:1802.01451},
year = {2018}
}
备注
22 pages, 2 figures, 9 tables, 1 equation. This is a post-peer-review, pre-copyedit version of an article published in Machine Translation Journal. The final authenticated version will be available online at the journal page. arXiv admin note: substantial text overlap with arXiv:1706.04389