中文

SliceMoE:在误差率约束下高效MoE推理的位切片专家缓存

硬件体系结构 2026-04-03 v4

摘要

MoE模型通过条件计算实现有效的规模扩展,但其庞大的参数规模和昂贵的专家卸载使得设备内部署具有挑战性。现有的加速技术,如预取或专家聚类,常常增加能耗或降低专家多样性。我们提出SliceMoE,一个面向误差率受限部署的能效高效MoE推理框架。SliceMoE引入动态位切片缓存(Dynamic Bit-Sliced Caching, DBSC),在切片级别上缓存专家并按需分配精度以扩大有效专家容量。为支持无内存重复的混合精度专家,我们提出了校准无感的非对称木屋模型量化(Calibration-Free Asymmetric Matryoshka Quantization, AMAT),这是一种基于截断的方案,维持低位和高位切片之间的兼容性。我们进一步引入预测缓存热身(Predictive Cache Warmup, PCW),以重塑预填期间的缓存内容以减少早期解码冷漏失。我们在DeepSeek-V2-Lite和Qwen1.5-MoE-A2.7B上进行评估,SliceMoE在解码阶段的能耗分别降低最高可达2.37倍和2.85倍,解码延迟降低最高可达1.81倍和1.64倍,同时保持接近高位精度。这些结果表明,切片级别的缓存使得设备内MoE部署成为可能。

关键词

引用

@article{arxiv.2512.12990,
  title  = {SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference},
  author = {Yuseon Choi and Sangjin Kim and Jungjun Oh and Gwangtae Park and Byeongcheol Kim and Hoi-Jun Yoo},
  journal= {arXiv preprint arXiv:2512.12990},
  year   = {2026}
}

备注

Design Automation Conference (DAC) 2026