中文

揭示大型语言模型中混合专家模型的隐藏协作机制

机器学习 2025-04-18 v1 人工智能

摘要

基于混合专家的大型语言模型通过将输入动态路由至专业化专家,在多任务适应性方面展现出巨大潜力。尽管取得了成功,但专家间的协作机制仍不甚明了,限制了这类模型的可解释性与优化。本文聚焦两个关键问题:(1) 识别专家协作模式,以及 (2) 通过专家剪枝优化 MoE LLMs。针对第一个问题,我们提出一种分层稀疏字典学习(HSDL)方法,以揭示专家间的协作模式。针对第二个问题,我们引入贡献感知专家剪枝(CAEP)算法,有效剪除低贡献专家。大量实验表明,专家协作模式与特定输入类型密切相关,并在各种任务中表现出语义显著性。此外,剪枝实验表明,我们的方法平均提升整体性能 2.5%,优于现有方法。这些发现为提升 MoE LLMs 的效率与可解释性提供了宝贵见解,使人们更清晰地理解专家间交互并改进模型优化。

关键词

引用

@article{arxiv.2504.12359,
  title  = {Unveiling Hidden Collaboration within Mixture-of-Experts in Large Language Models},
  author = {Yuanbo Tang and Yan Tang and Naifan Zhang and Meixuan Chen and Yang Li},
  journal= {arXiv preprint arXiv:2504.12359},
  year   = {2025}
}