语言特异性神经元:大语言模型多语言能力的关键
计算与语言
2024-06-07 v2
摘要
大语言模型(LLM)展现出卓越的多语言能力,而无需在专门策划的多语言平行语料库上进行预训练。解释 LLM 处理多语言文本的底层机制仍然是一个具有挑战性的问题。在本文中,我们深入探究 LLM 中 Transformer 架构的组成,以定位语言特异性区域。具体而言,我们提出了一种新的检测方法,即语言激活概率熵(LAPE),用于识别 LLM 内的语言特异性神经元。基于 LAPE,我们在多个代表性 LLM(如 LLaMA-2、BLOOM 和 Mistral)上进行了全面的实验。我们的发现表明,LLM 处理特定语言的熟练程度主要归因于一小部分神经元,这些神经元主要位于模型的顶层和底层。此外,我们展示了通过选择性激活或停用语言特异性神经元来“引导”LLM 输出语言的可行性。我们的研究为理解和探索 LLM 的多语言能力提供了重要证据。
引用
@article{arxiv.2402.16438,
title = {Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models},
author = {Tianyi Tang and Wenyang Luo and Haoyang Huang and Dongdong Zhang and Xiaolei Wang and Xin Zhao and Furu Wei and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2402.16438},
year = {2024}
}
备注
Accepted by ACL 2024