破解巴别塔:探索大语言模型的多语言激活模式及其应用
计算与语言
2024-10-08 v3
摘要
近年来,大语言模型(LLM)在自然语言处理(NLP)领域取得了巨大突破,但在处理不同语言时对其内部神经元活动的理解仍然不足。我们设计了一种将稠密 LLM 转换为细粒度混合专家(MoE)架构的方法,并通过专家激活频率热力图可视化研究了 LLM 的多语言激活模式。通过对不同模型族、不同模型规模及不同变体的综合实验,我们分析了 LLM 在处理不同语言时内部神经元激活模式的异同。具体而言,我们调查了高频激活专家的分布、多语言共享专家的情况、多语言激活模式是否与语系相关,以及指令微调对激活模式的影响。我们进一步探索了利用发现的专家激活频率差异来指导稀疏激活和剪枝。实验结果表明,我们的方法显著优于随机专家剪枝,甚至在某些语言上超过了未剪枝模型的性能。此外,我们发现基于激活水平差异为不同层配置不同的剪枝率可以获得更好的结果。我们的发现揭示了 LLM 内部的多语言处理机制,并利用这些见解为稀疏激活和模型剪枝等应用提供了新视角。
引用
@article{arxiv.2402.16367,
title = {Unraveling Babel: Exploring Multilingual Activation Patterns of LLMs and Their Applications},
author = {Weize Liu and Yinlong Xu and Hongxia Xu and Jintai Chen and Xuming Hu and Jian Wu},
journal= {arXiv preprint arXiv:2402.16367},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main Conference