中文

利用众包工作者的机器翻译领域自适应

计算与语言 2022-10-31 v1

摘要

尽管使用大型领域内平行语料库训练的机器翻译模型取得了显著结果,但在无领域内数据可用时其表现仍然很差。这种情况在目标领域数据有限时限制了机器翻译的适用性。然而,许多领域对高质量领域特定机器翻译模型有巨大需求。我们提出了一种框架,借助众包工作者高效且有效地从网络收集目标领域的平行句对。利用收集到的平行数据,我们可以快速将机器翻译模型自适应到目标领域。我们的实验表明,所提方法能以合理成本在数天内收集目标领域平行数据。我们在五个领域上进行了测试,领域自适应模型相比通用翻译模型将 BLEU 分数平均提高了 +7.8 分,最高达 +19.7。

关键词

引用

@article{arxiv.2210.15861,
  title  = {Domain Adaptation of Machine Translation with Crowdworkers},
  author = {Makoto Morishita and Jun Suzuki and Masaaki Nagata},
  journal= {arXiv preprint arXiv:2210.15861},
  year   = {2022}
}

备注

Accepted at EMNLP 2022 Industry Track