提升土著语言翻译:多语言模型实验
计算与语言
2023-05-30 v1
摘要
本文描述了CIC NLP向AmericasNLP 2023关于美洲土著语言机器翻译系统共享任务提交的内容。我们给出了三种方法的系统描述。我们使用了两个多语言模型,即M2M-100和mBART50,以及一个双语(一对一)——Helsinki NLP西班牙语-英语翻译模型,并尝试了不同的迁移学习设置。我们对来自美洲的11种语言进行了实验,并报告了所使用的设置以及所取得的成果。总体而言,mBART设置在11种语言中有3种上能够超越基线。
引用
@article{arxiv.2305.17406,
title = {Enhancing Translation for Indigenous Languages: Experiments with Multilingual Models},
author = {Atnafu Lambebo Tonja and Hellina Hailu Nigatu and Olga Kolesnikova and Grigori Sidorov and Alexander Gelbukh and Jugal Kalita},
journal= {arXiv preprint arXiv:2305.17406},
year = {2023}
}
备注
Accepted to Third Workshop on NLP for Indigenous Languages of the Americas