面向低资源语言的大规模多语言文本翻译
计算与语言
2024-01-31 v1
摘要
翻译成极度低资源语言,既有拯救和复兴这些语言的文化目标,也有协助当地社区日常需求的人道主义目标,而近期的新冠疫情加速了这些需求。在许多人道主义工作中,翻译成极低资源语言通常不需要一个通用的翻译引擎,而是需要一个专用的、针对特定文本的翻译引擎。例如,医疗记录、卫生程序、政府通讯、应急程序和宗教文本都属于有限文本。虽然面向所有语言的通用翻译引擎并不存在,但将多语言已知的有限文本翻译成新的低资源语言是可能的,并能减少人工翻译的工作量。我们尝试利用来自资源丰富语言的翻译资源,为那些在多语言中可用的、众所周知的文本,高效地生成翻译成新的低资源语言的最佳可能质量。为了实现这一目标,我们认为,在将封闭文本翻译成低资源语言时,泛化到领域外文本并非必要,但泛化到新语言却是必要的。性能提升来源于通过精心选择相近的语系、同一语言内风格一致的语料库级释义,以及将现有大型预训练多语言模型先策略性地适配到领域、再适配到语言,从而实现的大规模源语言并行。这种性能提升使得机器翻译系统能够与人工翻译人员协作,以加快翻译成新的低资源语言的进程。
引用
@article{arxiv.2401.16582,
title = {Massively Multilingual Text Translation For Low-Resource Languages},
author = {Zhong Zhou},
journal= {arXiv preprint arXiv:2401.16582},
year = {2024}
}
备注
191 pages. Published on Dec 20, 2023. Ph.D. thesis @ Language Technology Institute, School of Computer Science, Carnegie Mellon University. https://doi.org/10.1184/R1/24992787.v1