ButterflyMoE:基于结构化蝴蝶轨道的次线性三值专家
机器学习
2026-03-06 v4 人工智能
摘要
线性内存缩放存储 个独立的专家权重矩阵需要 内存,这超出了边缘设备的内存预算。当前的压缩方法(如量化、剪枝和低秩分解)虽降低了常数因子,但未解决缩放瓶颈。我们提出了 ButterflyMoE,该方法不将专家视为独立的权重矩阵,而是将其视为统一共享量化基底的几何重定向。专家的多样性源于对共享容量的不同视角,而非冗余存储。通过对共享的三值原型应用学习到的旋转,每个专家仅需 内存,在专家数量上呈次线性。关键洞察在于:在量化下训练这些旋转可减少激活异常值,并稳定静态方法会崩溃的极低比特训练。在语言建模基准测试中,ButterflyMoE 在 256 个专家下实现了 150 的内存缩减,且准确率损失可忽略不计。ButterflyMoE 允许多个专家部署于边缘受限设备上,表明几何参数化打破了线性缩放。
引用
@article{arxiv.2601.13563,
title = {ButterflyMoE: Sub-Linear Ternary Experts via Structured Butterfly Orbits},
author = {Aryan Karmore},
journal= {arXiv preprint arXiv:2601.13563},
year = {2026}
}