MLPMoE:稀疏化密集LLM MLP的零样态建构性变形
机器学习
2025-11-27 v1 人工智能
摘要
大型语言模型(LLM)主要以稠密变换器形式部署,其中每层前馈块中的每个参数都为每个token激活。虽然结构简单,但计算上效率低下,因为推理成本随参数数量线性增长。最近的升级方法如MoEfication、CMoE、ToMoE和MoORE表明,许多有用计算实际上存在于稠密前馈网络内部的稀疏、准模块化子结构中,但这些方法通常依赖于聚类、激活轮廓、奇异值分解或需要校准数据的自定义路由。本文引入MLPMoE(MLP Mixture-of-Experts),一种无需训练的、确定性的转换,将稠密MLP在transformer块中重构为静态、高基数混合专家。该转换采用简单的张量切片和求和,将张量并行的代数重新解释为拓扑转换而非分布式训练模式。我们进一步引入Fractal Fade(分支稀疏化)和Compensated Pruning(方差保持的分支削减)作为结构稀疏的轻量机制。在Qwen2.5-0.5B-Instruct和DeepSeek-R1-Distill-Llama-8B上,零样态MLPMoE变形使代理困惑度指标偏差小于0.05%,同时保持参数数量基本不变。在8B模型上,差分稀疏删除约20%的MLP参数,困惑度仍保持在密集基线的约2%以内。该方法完全在现有检查点上进行后处理,不需要梯度、校准集或路由训练。代码已公开于https://gist.github.com/iwallarm/fc2ef1eddf226ca7814f9e5e2ae9bad1。
引用
@article{arxiv.2511.21089,
title = {MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts},
author = {Ivan Novikov},
journal= {arXiv preprint arXiv:2511.21089},
year = {2025}
}