全局训练,局部定制:面向濒危语言的最小化多语言翻译
计算与语言
2023-05-09 v1
摘要
在许多人道主义场景中,翻译为极度低资源语言通常不需要一个通用的翻译引擎,而需要一个专用的、针对特定文本的翻译引擎。例如,医疗记录、卫生程序、政府通信、紧急程序和宗教文本都是有限文本。虽然面向所有语言的通用翻译引擎并不存在,但将多语言中已知的有限文本翻译为新的濒危语言是可能的,并可减少人工翻译工作量。我们尝试利用来自许多富资源语言的翻译资源,为新出现的、极度低资源的语言中一份已知且以多种语言存在的文本高效产出尽可能最佳的翻译质量。我们考察了两种方法:1. 为在新语言中启动翻译而最优地选择种子句,以期对较大目标文本的其余部分获得最佳泛化;2. 我们将来自许多其他语言的大型通用多语言翻译引擎适配到专注于新未知语言中的特定文本。我们发现,先将大型预训练多语言模型适配到领域/文本,再适配到极度低资源语言效果最佳。若同时选择一组最优种子句,我们可将新测试语言上的平均 chrF 性能从 21.9 的基线提升至 50.7,同时将新未知语言中的种子句数量减少至仅约 1,000 句。
引用
@article{arxiv.2305.03873,
title = {Train Global, Tailor Local: Minimalist Multilingual Translation into Endangered Languages},
author = {Zhong Zhou and Jan Niehues and Alex Waibel},
journal= {arXiv preprint arXiv:2305.03873},
year = {2023}
}
备注
In Proceedings of the 6th Workshop on Technologies for Machine Translation of Low-Resource Languages (LoResMT) of the 17th Conference of the European Chapter of the Association for Computational Linguistic in 2023