中文

NepTam: 尼泼尔-塔曼并行语料库及基准机器翻译实验

计算与语言 2026-03-17 v1 人工智能 机器学习

摘要

现代翻译系统高度依赖高质量的大规模平行数据以实现最佳性能。然而,对于大多数南亚语言而言,这类资源基本不可得。其中,尼泼尔语和塔曼语就属于此类,塔曼语是该地区数字资源最匮乏的语言之一。本工作通过构建NepTam20K(2万条黄金标准平行语料库)和NepTam80K(8万条合成尼泼尔-塔曼平行语料库)来弥补这一差距,两者均为句子对齐的平行语料,旨在支持机器翻译。该数据集通过一系列流程构建,包括从尼泼尔新闻及在线资源抓取数据、预处理、语义过滤、在尼泼尔语语料库中按时态和极性进行平衡(NepTam20K数据集)、由尼泼尔语母语者进行塔曼语翻译,以及由专家塔曼语言学家进行验证。数据集覆盖五个领域:农业、卫生、教育与技术、文化及一般交流。为评估该数据集,本文使用各种多语言预训练模型进行基准机器翻译实验:mBART、M2M-100、NLLB-200以及一个基础Transformer模型。在NLLB-200模型上进行微调,尼泼尔-塔曼翻译和塔曼-尼泼尔翻译的SacreBLEU最高分别达到40.92和45.26。

关键词

引用

@article{arxiv.2603.14053,
  title  = {NepTam: A Nepali-Tamang Parallel Corpus and Baseline Machine Translation Experiments},
  author = {Rupak Raj Ghimire and Bipesh Subedi and Balaram Prasain and Prakash Poudyal and Praveen Acharya and Nischal Karki and Rupak Tiwari and Rishikesh Kumar Sharma and Jenny Poudel and Bal Krishna Bal},
  journal= {arXiv preprint arXiv:2603.14053},
  year   = {2026}
}

备注

Accepted in LREC 2026