中文

多语言语言模型绩效差异的根源:内在建模难度还是设计选择?

计算与语言 2026-04-13 v3

摘要

多语言语言模型(LMs)虽能提供更广泛的 NLP 访问,但当前系统在世界各语言上呈现不均衡的性能。本 survey 检查这些差距为何持续存在,以及是否反映内在语言难度或建模制造 artifacts。我们围绕两个问题组织文献:语言差异是否源于表示和分配选择(如分词、编码、数据暴露、参数共享),而非固有复杂度;哪些设计选择缓解了在异构语言间的不平等。我们审阅语言特征,包括正字法、形态学、词汇多样性、语法、信息密度和类型距离,将其与具体建模机制关联。实践中,正字法、编码和数据暴露标准化后,差距常缩小,这表明许多显著难度源于当前建模选择。我们将这些见解整合为分词、抽样、架构和评估的设计建议,以支持更平衡的多语言 LMs。

关键词

引用

@article{arxiv.2601.07220,
  title  = {The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?},
  author = {Chen Shani and Yuval Reif and Nathan Roll and Dan Jurafsky and Ekaterina Shutova},
  journal= {arXiv preprint arXiv:2601.07220},
  year   = {2026}
}