非对称资源一对多神经翻译中的迁移学习与子词采样
计算与语言
2020-12-10 v2
摘要
已有多种方法可改进低资源语言的神经机器翻译:可通过预训练或数据增强利用单语数据;可通过多语言模型中的参数共享或迁移学习使用相关语言对的平行语料;可应用子词分割与正则化技术以确保词汇的高覆盖率。我们在非对称资源一对多翻译任务的背景下回顾这些方法,其中一对目标语言相关,一种为极低资源语言,另一种为较高资源语言。我们在三项人为受限的翻译任务——英语到爱沙尼亚语(低资源)与芬兰语(高资源)、英语到斯洛伐克语与捷克语、英语到丹麦语与瑞典语——以及一项真实任务挪威语到北萨米语与芬兰语上测试了各类方法。实验显示,尤其对于调度多任务学习、去噪自编码器与子词采样具有正向效果。
引用
@article{arxiv.2004.04002,
title = {Transfer learning and subword sampling for asymmetric-resource one-to-many neural translation},
author = {Stig-Arne Grönroos and Sami Virpioja and Mikko Kurimo},
journal= {arXiv preprint arXiv:2004.04002},
year = {2020}
}
备注
24 pages, 12 tables, 7 figures. Accepted (Nov 2020) for publication in the Machine Translation journal Special Issue on Machine Translation for Low-Resource Languages (Springer)