面向密切相近语言的极低资源机器翻译
计算与语言
2021-05-28 v1
摘要
改进极低资源神经机器翻译的一种有效方法是多语训练,而利用单语数据通过回译方法创建合成双语语料库可进一步提升其效果。本工作聚焦于来自乌拉尔语系的密切相近语言:爱沙尼亚语和芬兰语地理区域的语言。我们发现多语学习与合成语料库提高了我们所拥有数据的每一语言对的翻译质量。我们表明迁移学习与微调对于极低资源机器翻译非常有效并取得了最佳结果。我们为沃罗语、北萨米语和南萨米语收集了新的平行数据,并给出了这些语言神经机器翻译的首次结果。
引用
@article{arxiv.2105.13065,
title = {Extremely low-resource machine translation for closely related languages},
author = {Maali Tars and Andre Tättar and Mark Fišel},
journal= {arXiv preprint arXiv:2105.13065},
year = {2021}
}
备注
Accepted at Nodalida'2021