中文

BhashaSutra:印度 NLP 数据集、语料库与资源的任务导向统一调查

计算与语言 2026-04-21 v1

摘要

印度的语言景观涵盖 22 种常规语言和数百种边缘方言,推动了 NLP 数据集、基准和预训练模型的快速增长。然而,没有专门调查聚焦于为印度语言开发的资源。现有的综述要么仅关注少数高资源语言,要么将印度语言纳入更广泛的多语言环境中,限制了对低资源和在文化多样性方面较为丰富的语言的覆盖。为填补这一空白,我们提出了印度 NLP 资源的首个统一调查,覆盖 200 多个数据集、50 多个基准以及 100 多个模型、工具和系统,涉及文本、语音、多模态和文化嵌入任务。我们按语言现象、领域和模态组织资源;分析了标注、评估和模型设计中的趋势;并确定了数据稀疏、语言覆盖不均、脚本多样性以及有限的文化和领域泛化等持续挑战。该调查为在印度语言生态系统中进行平等、文化嵌入和可扩展的 NLP 研究提供了统一的基础。

关键词

引用

@article{arxiv.2604.18423,
  title  = {BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources},
  author = {Raghvendra Kumar and Devankar Raj and Sriparna Saha},
  journal= {arXiv preprint arXiv:2604.18423},
  year   = {2026}
}

备注

Accepted to ACL 2026 (Main Conference)