Toucan:面向 150 个非洲语言对的多对多翻译
计算与语言
2024-07-15 v2
摘要
我们致力于填补自然语言处理 (NLP) 中的关键差距,引入一系列资源以改进面向低资源语言的机器翻译 (MT),特别聚焦非洲语言。首先,我们引入两个语言模型 (LMs),Cheetah-1.2B 和 Cheetah-3.7B,分别包含 12 亿和 37 亿参数。随后,我们对上述模型进行微调,创建 Toucan——一个面向 156 个非洲语言对的非洲中心机器翻译模型。为评估 Toucan,我们仔细构建了广泛的机器翻译基准,称为 AfroLingu-MT,专为评估机器翻译而设计。Toucan 在非洲语言机器翻译方面显著优于其他模型,展示了其在 MT 任务中的卓越性能。最后,我们训练了一个新模型 spBLEU-1K,以提升覆盖 1000 种语言(包括 614 种非洲语言)的翻译评估指标。本工作旨在推动 NLP 领域的发展,特别是在资源有限的地区如非洲,促进跨文化理解和知识交流。Toucan 项目的 GitHub 仓库地址为 https://github.com/UBC-NLP/Toucan。
引用
@article{arxiv.2407.04796,
title = {Toucan: Many-to-Many Translation for 150 African Language Pairs},
author = {AbdelRahim Elmadany and Ife Adebara and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2407.04796},
year = {2024}
}