中文

提升土著语言翻译:多语言模型实验

计算与语言 2023-05-30 v1

摘要

本文描述了CIC NLP向AmericasNLP 2023关于美洲土著语言机器翻译系统共享任务提交的内容。我们给出了三种方法的系统描述。我们使用了两个多语言模型,即M2M-100和mBART50,以及一个双语(一对一)——Helsinki NLP西班牙语-英语翻译模型,并尝试了不同的迁移学习设置。我们对来自美洲的11种语言进行了实验,并报告了所使用的设置以及所取得的成果。总体而言,mBART设置在11种语言中有3种上能够超越基线。

关键词

引用

@article{arxiv.2305.17406,
  title  = {Enhancing Translation for Indigenous Languages: Experiments with Multilingual Models},
  author = {Atnafu Lambebo Tonja and Hellina Hailu Nigatu and Olga Kolesnikova and Grigori Sidorov and Alexander Gelbukh and Jugal Kalita},
  journal= {arXiv preprint arXiv:2305.17406},
  year   = {2023}
}

备注

Accepted to Third Workshop on NLP for Indigenous Languages of the Americas