位置认知特化:大语言模型在哪里学会理解和说你的语言?
计算与语言
2026-04-02 v1
摘要
将大语言模型(LLMs)适配到新语言是一个昂贵且不透明的过程。理解语言模型如何习得新语言和多语言能力对于实现高效适配至关重要。多语言可解释性研究的先前工作主要关注训练模型如何处理多语言指令,而未探索它们在训练期间习得新语言的机制。我们通过两种功能性认知特化——语言感知(输入理解)和生成(输出生成)——的视角,在仅解码器变换器上研究了这些训练动态。通过在低资源语言上的实验,我们展示了感知特化和生成特化如何在语言模型的不同区域中涌现,方法是从模型的输入和输出方向运行层消融扫描。基于观察到的特化模式,我们提出了 CogSym,一种逐层启发式方法,通过仅微调少量早期和晚期层来实现有效适配。我们证明,仅微调最外层 25% 的层即可在下游任务性能上与完整微调基线保持 2-3% 以内的偏差。CogSym 产生了与 LoRA 等适配器方法一致的性能,展示了超越完整微调的泛化能力。这些发现为更好地理解大语言模型如何学习新语言提供了见解,并推动走向可访问和包容性的语言建模。
引用
@article{arxiv.2604.00923,
title = {Positional Cognitive Specialization: Where Do LLMs Learn To Comprehend and Speak Your Language?},
author = {Luis Frentzen Salim and Lun-Wei Ku and Hsing-Kuo Kenneth Pao},
journal= {arXiv preprint arXiv:2604.00923},
year = {2026}
}
备注
Accepted to AAAI26 Main