中文

使用稀疏自编码器揭示大语言模型中的跨语言差异

计算与语言 2025-07-28 v1 人工智能

摘要

多语言大语言模型(LLM)表现出强大的跨语言泛化能力,但在诸如 ARC-Challenge、MMLU 和 HellaSwag 等常见基准测试中,中低资源语言的表现常常不足。我们分析了 Gemma-2-2B 在全部 26 层残差层和 10 种语言(中文 zh、俄语 ru、西班牙语 es、意大利语 it,以及中低资源语言包括印尼语 id、加泰罗尼亚语 ca、马拉里语 mr、马拉雅拉姆语 ml 和印地语 hi,英文 en 作为参考)中的激活模式。通过稀疏自编码器(SAEs),我们揭示了激活模式存在系统性差异。中低资源语言在早期层级中接收到的激活最高可低达 26.27%,在更深层级中仍保持约 19.89% 的持续差距。为此,我们应用基于激活的微调,通过低秩适配(LoRA)实现了显著的激活提升,例如马来语和印地语分别达到 87.69% 和 86.32%,同时保持英文约 91% 的性能。微调后,基准测试结果显示出温和但持续的改进,凸显了激活对提升多语言 LLM 性能的关键作用。

关键词

引用

@article{arxiv.2507.18918,
  title  = {Uncovering Cross-Linguistic Disparities in LLMs using Sparse Autoencoders},
  author = {Richmond Sin Jing Xuan and Jalil Huseynov and Yang Zhang},
  journal= {arXiv preprint arXiv:2507.18918},
  year   = {2025}
}