低资源印地语言机器翻译平行语料库:综合综述
计算与语言
2025-04-23 v2 机器学习
摘要
平行语料库在训练机器翻译(MT)模型中发挥着重要作用,尤其是对于资源匮乏的语言,因高质量双语数据稀缺。本综述提供了关于印地语言可用平行语料库的全面概述,这些语料库跨越多样的语言家族、脚本和区域变体。我们将这些语料库分为文本-文本、代码切换和各种多模态数据集类别,突出其在开发健全的多语言 MT 系统中的重要性。除了资源枚举之外,我们还批判性地检查了语料库创建中所面临的挑战,包括语言多样性、脚本变体、数据稀缺以及非正式文本内容的盛行。我们还就诸如对齐质量和领域代表性等方面对这些语料库进行评估。此外,我们讨论了诸如印地语言间数据不平衡、质量与数量之间的权衡,以及噪声、非正式和方言数据对 MT 性能的影响等开放性挑战。最后,我们概述了未来方向,包括利用跨语言迁移学习、扩展多语言数据集以及整合多模态资源以提高翻译质量。据我们了解,本文是首个针对低资源印地语言在机器翻译语境下进行全面综述。
引用
@article{arxiv.2503.04797,
title = {Parallel Corpora for Machine Translation in Low-resource Indic Languages: A Comprehensive Review},
author = {Rahul Raja and Arpita Vats},
journal= {arXiv preprint arXiv:2503.04797},
year = {2025}
}
备注
Accepted in NACCL