BhashaSutra:印度 NLP 数据集、语料库与资源的任务导向统一调查
计算与语言
2026-04-21 v1
摘要
印度的语言景观涵盖 22 种常规语言和数百种边缘方言,推动了 NLP 数据集、基准和预训练模型的快速增长。然而,没有专门调查聚焦于为印度语言开发的资源。现有的综述要么仅关注少数高资源语言,要么将印度语言纳入更广泛的多语言环境中,限制了对低资源和在文化多样性方面较为丰富的语言的覆盖。为填补这一空白,我们提出了印度 NLP 资源的首个统一调查,覆盖 200 多个数据集、50 多个基准以及 100 多个模型、工具和系统,涉及文本、语音、多模态和文化嵌入任务。我们按语言现象、领域和模态组织资源;分析了标注、评估和模型设计中的趋势;并确定了数据稀疏、语言覆盖不均、脚本多样性以及有限的文化和领域泛化等持续挑战。该调查为在印度语言生态系统中进行平等、文化嵌入和可扩展的 NLP 研究提供了统一的基础。
引用
@article{arxiv.2604.18423,
title = {BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources},
author = {Raghvendra Kumar and Devankar Raj and Sriparna Saha},
journal= {arXiv preprint arXiv:2604.18423},
year = {2026}
}
备注
Accepted to ACL 2026 (Main Conference)