中文

多语言文档级翻译实现从句子到文档的零样本迁移

计算与语言 2022-05-18 v2 机器学习

摘要

文档级神经机器翻译(DocNMT)通过引入跨句上下文实现连贯翻译。然而,尽管平行句子易于获取,对大多数语言对而言平行文档仍显匮乏。本文研究DocNMT中的上下文建模是否且如何通过多语言建模进行迁移。我们聚焦于从具备文档级数据的教师语言到无文档仅有句子级数据的学生语言的零样本迁移场景,并首次将文档级翻译视为迁移学习问题。使用简单的基于拼接的DocNMT,我们探究了3个因素对迁移的影响:具备文档级数据的教师语言数量、训练时文档级与句子级数据的平衡、以及平行文档的数据条件(真实vs.回译)。在Europarl-7和IWSLT-10上的实验显示了DocNMT多语言迁移的可行性,尤其在文档专属指标上。我们观察到更多教师语言与适当的数据平衡均有助于更好的迁移质量。令人惊讶的是,迁移对数据条件较不敏感,多语言DocNMT在使用回译或真实文档对时均能提供尚可的性能。

关键词

引用

@article{arxiv.2109.10341,
  title  = {Multilingual Document-Level Translation Enables Zero-Shot Transfer From Sentences to Documents},
  author = {Biao Zhang and Ankur Bapna and Melvin Johnson and Ali Dabirmoghaddam and Naveen Arivazhagan and Orhan Firat},
  journal= {arXiv preprint arXiv:2109.10341},
  year   = {2022}
}

备注

ACL2022