中文

面向机器翻译的 Tulu 资源

计算与语言 2024-03-29 v1

摘要

我们提出了首个用于英语-塔卢语翻译的平行数据集。塔卢语被归类为南达罗毗荼语族分支,主要在印度西南部由约 250 万人使用。我们的数据集是通过将人工翻译整合到多语言机器翻译资源 FLORES-200 中构建的。此外,我们在开发英语-塔卢语机器翻译模型的过程中将该数据集用于评估目的。对于模型的训练,我们利用了相关南达罗毗荼语言的可用资源。我们采用迁移学习方法,利用高资源语言与低资源语言之间的相似性。该方法使得即使在源语言与目标语言之间缺乏平行数据的情况下也能训练机器翻译系统,从而克服了低资源语言机器翻译开发中的一个重大障碍。我们的英语-塔卢语系统在未使用英语-塔卢语平行数据进行训练的情况下,较 Google Translate 高出 19 个 BLEU 点(截至 2023 年 9 月)。数据集和代码可在此处获取:https://github.com/manunarayanan/Tulu-NMT。

关键词

引用

@article{arxiv.2403.19142,
  title  = {A Tulu Resource for Machine Translation},
  author = {Manu Narayanan and Noëmi Aepli},
  journal= {arXiv preprint arXiv:2403.19142},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024