ButterflyViT:面向边缘设备的354倍专家压缩视觉Transformer
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
稀疏混合专家(MoE)视觉Transformer的部署仍面临由于线性专家内存扩展的挑战。线性内存扩展存储N个独立的专家权重矩阵,要求内存为O(N_E * d^2),超过边缘设备的内存预算。当前的压缩方法,如量化、剪枝和低秩分解,仅减少常数因子,仍未解决扩展瓶颈。我们提出了ButterflyViT,将专家视为统一共享已量化基质的几何重新定向,而非独立的权重矩阵。专家之间的多样性源于以不同角度观察共享容量,而非冗余存储。通过对共享的ternary原型应用学习旋转,每个专家的内存为O(d_model * d_ff + N_E * n_l * d),在专家数量上为亚线性。为解决视觉领域的独特挑战,引入了空间平滑正则化器,对相邻patch token之间的路由不规则性进行惩罚,将patch相关性转化为训练信号。在CIFAR-100上的图像分类任务中,ButterflyViT实现了64个专家时354倍的内存降低,同时几乎不损失准确率。ButterflyViT表明,几何参数化打破了线性扩展,使得多个专家能够适配受边缘设备约束的条件。
关键词
引用
@article{arxiv.2603.06746,
title = {ButterflyViT: 354$\times$ Expert Compression for Edge Vision Transformers},
author = {Aryan Karmore},
journal= {arXiv preprint arXiv:2603.06746},
year = {2026}
}