机器翻译中的源-目标域失配问题
计算与语言
2020-06-18 v2
摘要
尽管我们生活在一个日益互联的世界,不同地区仍呈现出截然不同的文化,且我们日常生活中经历的许多事件仅与我们所处的具体地域相关。因此,世界各地人们谈论的事物常常不同。在本工作中我们研究机器翻译中本地语境的影响,并假定尤其在低资源环境下,这会导致源语言与目标语言的域严重失配,因为这两种语言往往分布在世界上相距更远、文化特征更独特且本地事件无关的地区。我们首先形式化了源-目标域失配的概念,提出了量化该失配的度量,并提供了实证证据印证我们的直觉:操极不同语言的人所产生的自然文本表现出最显著的差异。我们以一项关于源-目标域失配如何影响低资源语言对机器翻译系统训练的实证研究作结。特别地,我们发现它严重影响了反向翻译,但通过将反向翻译与自训练结合并增加目标端单语数据的相对量可缓解这一退化。
引用
@article{arxiv.1909.13151,
title = {The Source-Target Domain Mismatch Problem in Machine Translation},
author = {Jiajun Shen and Peng-Jen Chen and Matt Le and Junxian He and Jiatao Gu and Myle Ott and Michael Auli and Marc'Aurelio Ranzato},
journal= {arXiv preprint arXiv:1909.13151},
year = {2020}
}