预测低资源语言的机器翻译性能:领域相似性的作用
计算与语言
2024-02-06 v1 机器学习
摘要
针对低资源语言(LRLs)进行多语言大语言模型的微调与测试既昂贵又充满挑战。尽管先前的研究利用机器学习方法预测了自然语言处理(NLP)任务的性能,但它们主要关注高资源语言,忽视了低资源语言及跨领域的偏移。聚焦于低资源语言,我们研究了三个因素:微调语料库的规模、微调语料库与测试语料库之间的领域相似性,以及源语言与目标语言之间的语言相似性。我们采用经典回归模型来评估这些因素如何影响模型性能。结果表明,领域相似性对预测机器翻译模型的性能具有最关键的影响。
引用
@article{arxiv.2402.02633,
title = {Predicting Machine Translation Performance on Low-Resource Languages: The Role of Domain Similarity},
author = {Eric Khiu and Hasti Toossi and David Anugraha and Jinyu Liu and Jiaxu Li and Juan Armando Parra Flores and Leandro Acros Roman and A. Seza Doğruöz and En-Shiun Annie Lee},
journal= {arXiv preprint arXiv:2402.02633},
year = {2024}
}
备注
13 pages, 5 figures, accepted to EACL 2024, findings