FactorLLM:通过混合专家因子化知识以增强大语言模型
计算与语言
2024-08-23 v1 人工智能
机器学习
摘要
最近的研究表明,大语言模型(LLM)中的前馈网络(FFN)在存储多样化语言和事实知识方面发挥着关键作用。常规方法常面临由于其单一且冗余的体系结构导致的知识混淆挑战,这需要更高效的解决方案,尤其是针对LLM。本文我们探索了LLM中的FFN计算范式,提出FactorLLM,这是一种将经过训练的稠密FFN分解为稀疏子网络的方法,无需进一步修改,同时保持相同的性能水平。此外,我们嵌入一种来自混合专家(MoE)的路由器,结合我们设计的先验近似(PA)损失项,以促进专家的动态激活和知识适应,从而加速计算过程并使用最小的训练数据和微调步骤提升性能。FactorLLM因此实现了高效的知识因子化,并激活特定于特定任务的专家组合,模拟人类大脑的交互式功能分割。广泛的实验表明,我们提出的FactorLLM有效,达到与源模型相当的性能,实现最高85%的模型性能,同时推理速度提升超过30%。代码:https://github.com/zhenwuweihe/FactorLLM。
引用
@article{arxiv.2408.11855,
title = {FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models},
author = {Zhongyu Zhao and Menghang Dong and Rongyu Zhang and Wenzhao Zheng and Yunpeng Zhang and Huanrui Yang and Dalong Du and Kurt Keutzer and Shanghang Zhang},
journal= {arXiv preprint arXiv:2408.11855},
year = {2024}
}