中文

通过从类型相似的高资源语言进行跨语言迁移来改进低资源机器翻译

计算与语言 2025-09-03 v2 机器学习

摘要

本研究考察了从类型相似的高资源语言进行跨语言迁移对低资源机器翻译的效果,通过对最初在高资源语言上训练的模型进行微调,使用来自目标低资源语言的有限数据。我们假设语言相似性使适应效率更高,从而减少对大量训练数据的需求。为此,我们在五个类型多样化的语言对上进行实验,涵盖不同族群: Semitic(现代标准阿拉伯语到利玛尔阿拉伯语)、Bantu(豪萨语到祖鲁语)、Romance(西班牙语到加泰罗尼亚语)、Slavic(斯洛伐克语到马其顿语)以及一种语言孤立语言(东阿尔曼语到西阿尔曼语)。结果显示,跨语言迁移在所有语言对上都一致地提高了翻译质量,确认了其在族群之外的适用性。作为次要分析,我们变更关键超参数学习率、批量大小、训练轮数和权重衰减,以确保结果不依赖于单一配置。我们发现,对于相似的语言对,适中批量大小(如 32)往往最为理想,较小的批量大小对不太相似的语言对也有帮助,而过高的学习率则可能 destabilize 训练。这些发现为跨语言族群的迁移学习提供了实证依据,并为在低资源环境中构建机器翻译系统提供了实用的指导。

关键词

引用

@article{arxiv.2501.00045,
  title  = {Improving Low-Resource Machine Translation via Cross-Linguistic Transfer from Typologically Similar High-Resource Languages},
  author = {Saughmon Boujkian},
  journal= {arXiv preprint arXiv:2501.00045},
  year   = {2025}
}