中文

ButterflyMoE:基于结构化蝴蝶轨道的次线性三值专家

机器学习 2026-03-06 v4 人工智能

摘要

线性内存缩放存储 NN 个独立的专家权重矩阵需要 O(Nd2)\mathcal{O}(N \cdot d^2) 内存,这超出了边缘设备的内存预算。当前的压缩方法(如量化、剪枝和低秩分解)虽降低了常数因子,但未解决缩放瓶颈。我们提出了 ButterflyMoE,该方法不将专家视为独立的权重矩阵,而是将其视为统一共享量化基底的几何重定向。专家的多样性源于对共享容量的不同视角,而非冗余存储。通过对共享的三值原型应用学习到的旋转,每个专家仅需 O(d2+Ndlogd)\mathcal{O}(d^2 + N \cdot d \log d) 内存,在专家数量上呈次线性。关键洞察在于:在量化下训练这些旋转可减少激活异常值,并稳定静态方法会崩溃的极低比特训练。在语言建模基准测试中,ButterflyMoE 在 256 个专家下实现了 150×\times 的内存缩减,且准确率损失可忽略不计。ButterflyMoE 允许多个专家部署于边缘受限设备上,表明几何参数化打破了线性缩放。

关键词

引用

@article{arxiv.2601.13563,
  title  = {ButterflyMoE: Sub-Linear Ternary Experts via Structured Butterfly Orbits},
  author = {Aryan Karmore},
  journal= {arXiv preprint arXiv:2601.13563},
  year   = {2026}
}