多语言语言模型绩效差异的根源:内在建模难度还是设计选择?
计算与语言
2026-04-13 v3
摘要
多语言语言模型(LMs)虽能提供更广泛的 NLP 访问,但当前系统在世界各语言上呈现不均衡的性能。本 survey 检查这些差距为何持续存在,以及是否反映内在语言难度或建模制造 artifacts。我们围绕两个问题组织文献:语言差异是否源于表示和分配选择(如分词、编码、数据暴露、参数共享),而非固有复杂度;哪些设计选择缓解了在异构语言间的不平等。我们审阅语言特征,包括正字法、形态学、词汇多样性、语法、信息密度和类型距离,将其与具体建模机制关联。实践中,正字法、编码和数据暴露标准化后,差距常缩小,这表明许多显著难度源于当前建模选择。我们将这些见解整合为分词、抽样、架构和评估的设计建议,以支持更平衡的多语言 LMs。
引用
@article{arxiv.2601.07220,
title = {The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?},
author = {Chen Shani and Yuval Reif and Nathan Roll and Dan Jurafsky and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2601.07220},
year = {2026}
}