中文

Finedeep: 通过多层细粒度专家缓解密集 LLM 中的稀疏激活

计算与语言 2025-02-19 v1

摘要

大语言模型在广泛的任务中展现了卓越性能。然而,密集模型通常遭受稀疏激活问题,即许多激活值趋于零(即被失活)。我们认为这可能限制了模型表示空间的高效探索。为缓解这一问题,我们提出 Finedeep,一种面向密集模型的深层细粒度专家架构。我们的框架将传统密集模型的前馈神经网络层划分为小型专家,并在多个子层中排列它们。一种新颖的路由机制被提出以确定每个专家的贡献。我们在各种模型规模上进行了广泛实验,证明我们的方法在困惑度和基准性能方面显著优于传统密集架构,同时保持可比的参数数量和浮点运算次数。此外,我们发现 Finedeep 在平衡深度和宽度时达到最优结果,具体通过调整专家子层数量和每个子层中的专家数量。实证结果证实 Finedeep 有效缓解了稀疏激活并高效利用了密集模型中的表示能力。

关键词

引用

@article{arxiv.2502.12928,
  title  = {Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts},
  author = {Leiyu Pan and Zhenpeng Su and Minxuan Lv and Yizhe Xiong and Xiangwen Zhang and Zijia Lin and Hui Chen and Jungong Han and Guiguang Ding and Cheng Luo and Di Zhang and Kun Gai and Deyi Xiong},
  journal= {arXiv preprint arXiv:2502.12928},
  year   = {2025}
}