中文

大语言模型宇宙中的看不见的语言

计算与语言 2026-01-01 v2

摘要

大语言模型是在海量多语言语料库上训练的,但这种丰富性掩盖了一个深刻的危机:全球7,613种活着的语言中,约有2,000种语言拥有数百万使用者,却在数字生态系统中几乎看不见。我们提出了一个关键框架,将语言活力(现实世界人口强度)和数字化(线上存在)的实证测量与后殖民理论和知识正义相结合,以解释为何AI系统中的语言不平等并非偶然而是结构性的。我们分析了所有已记录人类语言的数据,识别出四类:强盆地(33%,活力和数字化都高)、数字回声(6%,数字化高但活力衰退)、消逝之声(36%,两个维度都低)以及批判性的看不见之巨(27%,活力高但数字化几乎为零)——这些语言拥有数百万使用者,却在大语言模型宇宙中几乎不存在。我们证明,这些模式反映了从殖民时代语言等级制度到当代AI发展的延续性,构成了数字知识正义的体现。我们的分析表明,英语在AI中的主导地位并非技术必然,而是权力结构的产物,这些结构系统性地排除了被边缘化的语言知识。我们以建设性意见结束,提出去殖民化语言技术和 democratizing access to AI benefits 的启示。

关键词

引用

@article{arxiv.2510.11557,
  title  = {Invisible Languages of the LLM Universe},
  author = {Saurabh Khanna and Xinxu Li},
  journal= {arXiv preprint arXiv:2510.11557},
  year   = {2026}
}