中文

超越目录计数:低资源多语言 NLP 中的数据可见性不对称

计算与语言 2026-05-19 v1 人工智能 信息检索

摘要

多语言 NLP 常依赖中心化目录中的数据计数来刻画哪些语言处于资源丰富或资源贫乏状态。然而,这些目录仅记录一种数据可见性层次:已注册或机构分发的数据集。它们不一定反映数据集在研究文献中创建、引用或重用的情况。为检视这一差距,我们将基于目录的基线与文献背后的数据循环证据相结合。我们引入资源密度指数 (RDI),定义为每百万说话人所拥有的目录数据集数目,对 Ethnologue 中最常用 200 种语言计算得 RDI。其中 118 种语言(59%)在 LRE Map 和 Linguistic Data Consortium (LDC) 中平均 RDI 为零;另有 23 种低于 0.1,对应每一千万说话人最多一套目录数据集。随后,我们对这 141 种低可见性语言应用基于 LLM 的引用挖掘管道处理 Semantic Scholar 语料库。经人工验证与整合,我们识别出 609 个独特数据集,覆盖 53 种语言,其中 356 个通过工作公开链接保持可访问。这些结果揭示了 substantial 可见性差距:许多大规模说话人语言在目录记录中显得数据贫乏,却在研究文献中显示出明显的数据活动。我们的发现表明,多语言数据稀缺不仅是生产问题,更是文档、可发现性与长期可访问性的问题。代码与数据已公开于 https://github.com/zhiyintan/dataset-visibility-asymmetry。

关键词

引用

@article{arxiv.2605.17442,
  title  = {Beyond Catalogue Counts: the Dataset Visibility Asymmetry in Low-Resource Multilingual NLP},
  author = {Zhiyin Tan and Changxu Duan},
  journal= {arXiv preprint arXiv:2605.17442},
  year   = {2026}
}

备注

Accepted at the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)