中文

“少即是多”:基于少样本质量估计的语料过滤改进机器翻译

计算与语言 2023-06-07 v1

摘要

质量估计(QE)是在无参考译文时评估翻译质量的任务。QE 的目标与语料过滤任务一致,即我们对伪平行语料中存在的句对赋予质量分数。我们提出一种基于质量估计的过滤方法,从伪平行语料中提取高质量平行数据。据我们所知,这是将 QE 框架新颖地应用于从伪平行语料中提取高质量平行语料。通过使用该过滤后的语料进行训练,我们观察到对于英语-马拉地语、汉语-英语和印地语-孟加拉语语言对,机器翻译(MT)系统的性能较基线模型提升高达 1.8 个 BLEU 点。基线模型是在整个伪平行语料上训练的模型。我们的少样本 QE 模型从英语-马拉地语 QE 模型迁移学习,并仅在 500 个印地语-孟加拉语训练实例上微调,与基线模型相比,在印地语-孟加拉语语言对上显示出高达 0.6 个 BLEU 点的提升。这证明了在所讨论设定下迁移学习的潜力。QE 系统通常需要约(7K–25K)的训练数据。我们的印地语-孟加拉语 QE 仅用 500 个训练实例(为正常需求的 1/40)训练,并取得了可比的性能。本研究使用的所有脚本与数据集将公开可用。

关键词

引用

@article{arxiv.2306.03507,
  title  = {"A Little is Enough": Few-Shot Quality Estimation based Corpus Filtering improves Machine Translation},
  author = {Akshay Batheja and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2306.03507},
  year   = {2023}
}