中文

稀疏子网络增强:针对大语言模型中缺乏语言的支持

计算与语言 2026-02-05 v2

摘要

大语言模型 (LLMs) 在不同语言上的表现存在显著差异,尤其在高资源与低资源环境之间。我们提出了一种框架,通过针对性微调稀疏、与语言相关的子网络来提升缺乏语言支持的表现,同时保持通用能力。我们的方法利用语言激活概率熵 (LAPE)——一种信息论度量,可可靠地捕获语言特定的激活模式——识别语言相关神经元,并仅微调相应的权重。在 Llama-3.1-8B、Mistral-Nemo-12B 和 Aya-Expanse-8B 上进行实验,覆盖 12 个中低资源语言,结果显示我们的方法在全模型微调、FFN-only 微调、LoRA、IA^3 和随机子集基准中均表现一致优于,同时仅更新 0.2%-1% 的模型参数。我们进一步表明,稀疏、神经元级的微调可在不产生灾难性遗忘的情况下注入新的语言能力,潜在可应用于其他模型能力。权重更新和内部表示的机制分析揭示了 FFN 投影在语言适应中的非对称作用,并实现更好的跨语言对齐。最后,我们发布了覆盖 100 多种语言的语言神经元集合及相应的适配管道,为为大语言模型扩展对缺乏语言支持的语言提供了高性价比的路径。

关键词

引用

@article{arxiv.2510.13580,
  title  = {Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models},
  author = {Daniil Gurgurov and Tanja Baeumel and Josef van Genabith and Simon Ostermann},
  journal= {arXiv preprint arXiv:2510.13580},
  year   = {2026}
}

备注

preprint