INDIC DIALECT:面向印度语言方言的多任务基准测试
计算与语言
2026-01-16 v1
摘要
近期 NLP 进展主要聚焦于标准化语言,导致大多数低资源方言在印度场景中被严重忽视。在印度,情况尤为突出:尽管霍伦语是全球第三大语言(拥有超过 6 亿说话者),但其众多方言仍缺乏代表。奥利亚语也有约 4500 万说话者,情况类似。虽然已有一些包含标准霍伦语和奥利亚语的数据集,但其地区方言几乎没有网络存在。我们引入 INDIC-DIALECT,一个人工校对的包含 13000 句对的平行语料库,涵盖 11 种方言和 2 种语言:霍伦语和奥利亚语。使用该语料库,我们构建了一个包含三个任务的多任务基准:方言分类、多选题回答和机器翻译(MT)。我们的实验表明,像 GPT-4o 和 Gemini 2.5 这样的大型语言模型在分类任务上表现不佳。而经过微调的基于变换器的模型预训练于印度语言后,性能显著提升,例如将方言分类的 F1 分数从 19.6% 提升到 89.8%。对于方言到语言翻译,我们发现混合 AI 模型在 BLEU 分数上达到最高值 61.32,而基线得分为 23.36。有趣的是,由于生成方言句子的复杂性,我们发现语言到方言翻译时,\textbf{“规则为主,后接 AI”} 方法在 BLEU 分数上取得最佳值 48.44,而基线得分为 27.59。INDIC-DIALECT 因此是一个新的印度语言方言感知的基准,我们计划将其作为开源软件发布,以支持进一步的印度低资源方言研究。
引用
@article{arxiv.2601.10388,
title = {INDIC DIALECT: A Multi Task Benchmark to Evaluate and Translate in Indian Language Dialects},
author = {Tarun Sharma and Manikandan Ravikiran and Sourava Kumar Behera and Pramit Bhattacharya and Arnab Bhattacharya and Rohit Saluja},
journal= {arXiv preprint arXiv:2601.10388},
year = {2026}
}