中文

多语言大语言模型中的语言区域演化与语义对齐

计算与语言 2025-03-04 v2

摘要

大型语言模型(LLMs)在多语言情境中展现出惊人的性能。虽然最近的研究表明,LLMs可以在一种语言中学习的技能可转移到其他语言,但其背后的内部机制仍不清晰。我们观察到,LLMs在处理相同语言时,其神经元激活模式呈现相似性,揭示了关键语言区域的存在及其位置。此外,我们发现不同语言中处理相同语义句子的神经元激活模式相似,这表明LLMs将来自不同语言的语义相同输入映射到一个“通用语言”,即一种允许跨语言一致处理的常见语义潜在空间。随着训练进行和模型规模增加,这种语义对齐变得更加突出,导致更加语言无关的激活模式。此外,我们发现关键语言神经元集中在LLMs的前层和后层,在训练过程中逐渐变得更密集。BLOOM和LLaMA2上的实验支持了这些发现,突显了多语言LLMs在训练和扩大规模期间的结构演化。本文为理解LLMs的内部工作原理提供了洞见,为未来改进其跨语言能力提供了基础。

关键词

引用

@article{arxiv.2410.11718,
  title  = {Converging to a Lingua Franca: Evolution of Linguistic Regions and Semantics Alignment in Multilingual Large Language Models},
  author = {Hongchuan Zeng and Senyu Han and Lu Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2410.11718},
  year   = {2025}
}

备注

16 pages, 11 figures, 4 tables