中文

迈向不让任何印度语言掉队:为印度语言构建单语语料库、基准与模型

计算与语言 2023-05-25 v3

摘要

为拥有超过十亿说话者总体的印度语言构建自然语言理解(NLU)能力绝对至关重要。在本工作中,我们旨在沿三个重要轴线改进印度语言的 NLU 能力:(i)单语语料库(ii)NLU 测试集(iii)聚焦于印度语言的多语言 LLM。具体而言,我们策划了最大的单语语料库 IndicCorp,包含覆盖来自 4 个语系的 24 种语言的 20.9B 词元——较先前工作增加 2.3 倍,同时支持 12 种附加语言。接下来,我们创建了人工监督的基准 IndicXTREME,由涵盖 20 种语言的九项多样化 NLU 任务组成。跨语言与任务,IndicXTREME 共包含 105 个评测集,其中 52 个为文献中的新贡献。据我们所知,这是首个旨在为印度语言创建标准基准以测试预训练语言模型多语言零样本能力的努力。最后,我们训练了支持所有语言的先进模型 IndicBERT v2。跨语言与任务平均,该模型相较强基线取得了 2 个点的绝对提升。数据与模型可在 https://github.com/AI4Bharat/IndicBERT 获取。

关键词

引用

@article{arxiv.2212.05409,
  title  = {Towards Leaving No Indic Language Behind: Building Monolingual Corpora, Benchmark and Models for Indic Languages},
  author = {Sumanth Doddapaneni and Rahul Aralikatte and Gowtham Ramesh and Shreya Goyal and Mitesh M. Khapra and Anoop Kunchukuttan and Pratyush Kumar},
  journal= {arXiv preprint arXiv:2212.05409},
  year   = {2023}
}

备注

ACL 2023