基于零样本复述的多种语言机器翻译自动评估
计算与语言
2020-10-29 v2
摘要
我们将机器翻译评估任务构建为:以序列到序列复述器对机器翻译输出进行打分,并以人工参考为条件。我们提出将复述器训练为一个多语言 NMT 系统,将复述视为零样本翻译任务(例如捷克语到捷克语)。这使得复述器的输出模式以输入序列的拷贝为中心,代表了 MT 系统输出与人工参考匹配的最佳情形。我们的方法简单直观,且不需要人工判断进行训练。我们的单一模型(以 39 种语言训练)在 WMT 2019 句段级共享度量任务中所有语言上优于或与所有先前度量指标统计持平(古吉拉特语除外,该模型无训练数据)。我们还探索将我们的模型用于质量估计任务作为度量——以源语言而非参考为条件——并发现其在每一语言对上均显著优于 WMT 2019 质量估计共享任务的所有提交。
引用
@article{arxiv.2004.14564,
title = {Automatic Machine Translation Evaluation in Many Languages via Zero-Shot Paraphrasing},
author = {Brian Thompson and Matt Post},
journal= {arXiv preprint arXiv:2004.14564},
year = {2020}
}
备注
EMNLP2020