中文

印度语言本脚本语言识别基准数据集

计算与语言 2026-01-08 v3

摘要

语言识别任务是 NLP 中的关键基础步骤,常作为众多 NLP 应用(如多语言机器翻译、信息检索、问答和文本摘要)的预处理步骤。语言识别的核心挑战在于区分噪声、短句和代码混合环境中的语言。在印度语言之间,这更加困难,因为这些语言在词汇和音标上具有相似性,却存在显著差异。许多印度语言共享相同的脚本,这使得该任务更加具有挑战性。鉴于上述所有挑战,我们开发并发布了一个包含 25 万句子、涵盖 23 种语言(包括英语和所有 22 种官方印度语言)的数据集,标注了语言标识符,其中大多数语言的数据是全新的。我们还开发并发布了基线模型,采用最新的机器学习方法和微调预训练变换模型。我们的模型在语言识别任务上优于当前最好的预训练变换模型。该数据集和代码均可在 https://yashingle-ai.github.io/ILID/ 及 Huggingface 开源库中获取。

关键词

引用

@article{arxiv.2507.11832,
  title  = {ILID: Native Script Language Identification for Indian Languages},
  author = {Yash Ingle and Pruthwik Mishra},
  journal= {arXiv preprint arXiv:2507.11832},
  year   = {2026}
}

备注

10 pages, 1 figure, 6 tables