替代输入信号简化多语言机器翻译中的迁移
计算与语言
2021-10-18 v1
摘要
近期关于多语言机器翻译(MMT)的研究聚焦于语言间正向迁移的潜力,特别是高资源语言能够使低资源语言受益的情况。在训练MMT模型时,从一种语言对学到的监督信号可以通过多种源语言共享的token迁移到另一种语言对。然而,当源语言间的token重叠较小时,这种迁移会受到抑制,这在语言使用不同书写系统时自然显现。在本文中,我们通过用统一不同书写系统的替代信号(如音标、罗马化和音译输入)来增强训练数据,以解决迁移受阻的问题。我们在印度语系和突厥语系这两种书写系统不同但语言仍共享共同特征的语言家族上测试了这些信号。我们的结果表明,一种直接的多源自集成方法——在多种信号的混合数据上训练一个模型,并在推理时对同一模型输入不同信号得到的输出进行集成——在两个语系上均比强集成基线高出1.3个BLEU值。此外,我们发现通过自集成引入替代输入在训练集较小时特别有效,当仅能获取总训练数据的5%时,BLEU值提升高达+5。最后,我们的分析表明,包含替代信号能产生更高的一致性,并更准确地翻译命名实体,这对于提高自动化系统的真实性至关重要。
引用
@article{arxiv.2110.07804,
title = {Alternative Input Signals Ease Transfer in Multilingual Machine Translation},
author = {Simeng Sun and Angela Fan and James Cross and Vishrav Chaudhary and Chau Tran and Philipp Koehn and Francisco Guzman},
journal= {arXiv preprint arXiv:2110.07804},
year = {2021}
}