中文

开放语言数据计划:推动卡拉卡尔帕克低资源机器翻译

计算与语言 2024-09-09 v1

摘要

本研究为卡拉卡尔帕克语言贡献了多个方面:翻译至卡拉卡尔帕克的FLORES+ devtest数据集、每组10万对的乌兹贝克-卡拉卡尔帕克、俄语-卡拉卡尔帕克和英语-卡拉卡尔帕克平行语料库,以及开源的微调神经模型用于跨语言翻译。我们的实验比较了不同模型变体和训练方法, demonstrating了对现有基线方法的改进。该工作作为开放语言数据计划(OLDI)共享任务的一部分进行,旨在推动卡拉卡尔帕克的机器翻译能力,并为扩大NLP技术中的语言多样性做出贡献。

关键词

引用

@article{arxiv.2409.04269,
  title  = {Open Language Data Initiative: Advancing Low-Resource Machine Translation for Karakalpak},
  author = {Mukhammadsaid Mamasaidov and Abror Shopulatov},
  journal= {arXiv preprint arXiv:2409.04269},
  year   = {2024}
}

备注

Submitted to WMT 2024