中文

论神经机器翻译中跨文字模型迁移的罗马化方法

计算与语言 2020-10-01 v1

摘要

迁移学习是提升低资源机器翻译质量的常用策略。为实现嵌入层的最优迁移,子模型与父模型应共享词汇表的绝大部分。当迁移到使用不同文字的语言时则并非如此。我们探讨了此情形下罗马化的益处。结果表明,罗马化会带来信息损失,因此并非总是优于更简单的词汇表迁移方法,但可改善具有不同文字的相关语言之间的迁移。我们比较了两种罗马化工具,发现它们表现出不同程度的信息损失,从而影响翻译质量。最后,我们将罗马化扩展到目标端,表明当与简单的去罗马化模型结合时,这是一种成功的策略。

关键词

引用

@article{arxiv.2009.14824,
  title  = {On Romanization for Model Transfer Between Scripts in Neural Machine Translation},
  author = {Chantal Amrhein and Rico Sennrich},
  journal= {arXiv preprint arXiv:2009.14824},
  year   = {2020}
}

备注

accepted at Findings of EMNLP 2020