聚焦语言:揭示和利用多语言大型语言模型中的语言注意力头
计算与语言
2025-12-04 v2 人工智能
摘要
大型语言模型(LLM)日益支持多语言理解和生成。同时,针对其内部机制的解释性努力也日益增长,为增强多语言性能提供了见解。虽然多头自注意力(MHA)在许多领域已被证明至关重要,但其在多语言能力中的作用仍未得到充分探索。本文研究了MHA在支持LLM多语言处理中的贡献。我们提出了语言注意力头重要性得分(LAHIS),这是一种有效且高效的方法,通过对LLM进行单次前向和反向传递来识别注意力头对多语言能力的重要性。将LAHIS应用于Aya-23-8B、Llama-3.2-3B和Mistral-7B-v0.1,我们揭示了存在语言特定注意力头和语言通用注意力头。语言特定注意力头通过跨语言注意力传递引导模型向目标语言上下文移动,并有助于缓解非目标语言生成问题,为解决多语言LLM的挑战作出了贡献。我们还引入了一种轻量级适应方法,通过学习软注意力掩码来调节语言注意力头的输出,只需20个可调参数即可提高XQuAD准确率。总体而言,我们的工作从MHA的角度增强了LLM的可解释性和多语言能力。
引用
@article{arxiv.2511.07498,
title = {Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models},
author = {Xin Liu and Qiyang Song and Qihang Zhou and Haichao Du and Shaowen Xu and Wenbo Jiang and Weijuan Zhang and Xiaoqi Jia},
journal= {arXiv preprint arXiv:2511.07498},
year = {2025}
}
备注
Accepted by AAAI-2026