BhashaSetu:面向低资源机器翻译的数据导向方法
计算与语言
2026-05-27 v1 机器学习
摘要
我们提出BhashaSetu,这是一个 linguistically丰富的英文--马拉利语平行数据集,旨在解决低资源神经机器翻译(NMT)中持续存在的数据限制问题。马拉利语是由超过9500万人口使用的语言,在高质量平行语料库中仍处于欠represention状态。该数据集包含来自新闻、政治、医疗、文学和文化等异构来源的278万句对,并提供stemmed和lemmatized表示以支持形态感知分析。我们使用BLEU、spBLEU、chrF++和TER指标对多种最先进的翻译模型进行基准测试,并对NLLB-200-distilled-600M进行参数高效微调(LoRA)。我们的消融实验关键发现:语料库级去重是下游质量(移除后性能下降1.17 BLEU和2.21 chrF++)的最大预处理贡献者,这表明对低资源、形态丰富语言而言,严格的跨源语料卫生措施是一种低成本、高影响力的干预。该数据集已公开发布,以推动可重复且在低资源NMT研究中具有语言学意义的工作。
引用
@article{arxiv.2605.27050,
title = {BhashaSetu: A Data-Centric Approach to Low-Resource Machine Translation},
author = {Param Thakkar and Anushka Yadav and Michael Tiemann and Abhi Mehta and Akshita Bhasin and Shrinivas Khedkar},
journal= {arXiv preprint arXiv:2605.27050},
year = {2026}
}