AFRIDOC-MT:面向非洲语言的文档级机器翻译语料库
计算与语言
2025-10-15 v2
摘要
本文介绍了AFRIDOC-MT,一个涵盖英语和五种非洲语言(阿姆哈拉语、豪萨语、斯瓦希里语、约鲁巴语和祖鲁语)的文档级多平行翻译数据集。该数据集包含334份健康文档和271份信息技术新闻文档,全部由人工从英语翻译成这些语言。我们通过评估神经机器翻译模型和大语言模型在英语与这些语言之间的翻译(在句子级和伪文档级)进行了文档级翻译基准实验。这些输出被重新对齐以形成完整的文档进行评估。我们的结果表明,NLLB-200在标准NMT模型中取得了最佳平均性能,而GPT-4o优于通用大语言模型。对选定模型进行微调带来了显著的性能提升,但基于句子训练的模型难以有效泛化到更长的文档。此外,我们的分析揭示了一些大语言模型存在欠生成、词语或短语重复以及脱靶翻译等问题,尤其是对于非洲语言。
引用
@article{arxiv.2501.06374,
title = {AFRIDOC-MT: Document-level MT Corpus for African Languages},
author = {Jesujoba O. Alabi and Israel Abebe Azime and Miaoran Zhang and Cristina España-Bonet and Rachel Bawden and Dawei Zhu and David Ifeoluwa Adelani and Clement Oyeleke Odoje and Idris Akinade and Iffat Maab and Davis David and Shamsuddeen Hassan Muhammad and Neo Putini and David O. Ademuyiwa and Andrew Caines and Dietrich Klakow},
journal= {arXiv preprint arXiv:2501.06374},
year = {2025}
}
备注
EMNLP 2025