中文

基于集成与迁移学习的低资源机器翻译质量估计

计算与语言 2021-05-18 v1

摘要

机器翻译(MT)质量估计(QE)是一项对来自未知MT系统的给定翻译输出估计质量分数的任务。然而,低资源语言的QE分数通常难以处理且难以收集。本文关注第五届机器翻译会议(WMT20)的句子级QE共享任务,但处于更具挑战性的设定下。我们旨在预测给定翻译输出的QE分数,而训练时几乎未提供该配对语言的任何QE分数。我们提出一种基于集成的预测器-估计器QE模型并结合迁移学习,通过利用其他杂项语言的QE分数与目标语言的翻译结果来克服此类QE数据稀缺挑战。基于评估结果,我们详细分析了我们的各项扩展如何影响QE模型在多语言任务下执行迁移学习的可靠性与泛化能力。最终,我们凭借集成模型取得了最佳性能,该模型结合了以各单独语言预训练的模型及不同层级平行训练语料,Pearson相关系数为0.298,是基线的2.54倍。

关键词

引用

@article{arxiv.2105.07622,
  title  = {Ensemble-based Transfer Learning for Low-resource Machine Translation Quality Estimation},
  author = {Ting-Wei Wu and Yung-An Hsieh and Yi-Chieh Liu},
  journal= {arXiv preprint arXiv:2105.07622},
  year   = {2021}
}