利用多语言迁移学习改进原住民语言的神经机器翻译
计算与语言
2022-05-17 v1
摘要
涉及原住民语言(包括可能濒危的语言)的机器翻译(MT)因缺乏充足平行数据而具挑战性。我们描述了一种在迁移学习设定下利用双语与多语言预训练 MT 模型,将西班牙语译为十种南美洲原住民语言的方法。我们的模型在所考虑的十组语言对中有五组刷新了 SOTA,其中一组性能甚至翻倍。与先前通过数据增强扩充训练集的 SOTA 不同,我们保持低资源设定以检验模型在此约束下的有效性。尽管关于原住民语言的语言学信息稀缺,我们仍提供了若干定量与定性分析(如形态、分词与正字法方面)以语境化我们的结果。
引用
@article{arxiv.2205.06993,
title = {Improving Neural Machine Translation of Indigenous Languages with Multilingual Transfer Learning},
author = {Wei-Rui Chen and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2205.06993},
year = {2022}
}