大型语言模型的高维语际表示
计算与语言
2025-08-19 v5
摘要
在海量多语言数据集上训练的大型语言模型 (LLM) 暗示了语际结构的形成——即表示空间中的一个共享子空间。然而,关于这一现象的证据褒贬不一,使得尚不清楚这些模型是否真正发展出了统一的语际表示,还是呈现出部分对齐的结构。我们探索了在资源水平、类型学和地理区域上各不相同的 31 种语言;发现多语言 LLM 表现出不一致的跨语言对齐。为了解决这个问题,我们提出了一个语际表示框架,用于识别共享的语际语义子空间以及由于表示限制而存在的碎片化成分。我们引入了语际局部重叠 (ILO) 分数,通过比较高维表示的局部邻域结构来量化语际对齐。我们利用 ILO 研究了单语言微调对多语言 LLM 中语际表示的影响。我们的结果表明,仅在单一语言上训练会破坏早期层的对齐,而冻结这些层则能保留语际表示的对齐,从而改善跨语言泛化。这些结果验证了我们的框架和度量用于评估语际表示的有效性,并进一步强调了语际对齐对于可扩展的多语言学习至关重要。
引用
@article{arxiv.2503.11280,
title = {High-Dimensional Interlingual Representations of Large Language Models},
author = {Bryan Wilie and Samuel Cahyawijaya and Junxian He and Pascale Fung},
journal= {arXiv preprint arXiv:2503.11280},
year = {2025}
}