跨语言泛化与压缩:从语言特异性神经元到共享神经元
计算与语言
2025-06-03 v1
摘要
多语言语言模型 (MLLMs) 展现出了跨语言迁移知识的卓越能力,尽管它们的训练过程没有显式的跨语言监督。我们分析了三个 MLLM 的参数空间,以研究其表征在预训练过程中的演变,观察到了与压缩一致的模式:模型最初形成语言特异性表征,随着训练的推进,这些表征逐渐收敛为跨语言抽象。通过探测实验,我们观察到跨层的统一语言识别能力向更特化的层级功能发生了明显转变。为了进行更深入的分析,我们聚焦于编码不同语义概念的神经元。通过追踪它们在预训练期间的发展,我们展示了它们如何跨语言逐渐对齐。值得注意的是,我们识别出了特定的神经元,它们作为跨语言相同概念预测器的可靠性日益增强。
引用
@article{arxiv.2506.01629,
title = {Cross-Lingual Generalization and Compression: From Language-Specific to Shared Neurons},
author = {Frederick Riemenschneider and Anette Frank},
journal= {arXiv preprint arXiv:2506.01629},
year = {2025}
}
备注
Paper accepted for publication at ACL 2025 Main; 10 pages, 20 figures, 4 tables