中文

基于低秩补偿的带宽高效自适应混合专家模型

机器学习 2025-12-22 v1

摘要

混合专家模型通过稀疏激活扩展容量,但给内存和带宽带来压力。卸载通过按需获取专家来缓解GPU内存,但逐标记路由导致不规则传输,使推理成为I/O瓶颈。静态均匀量化降低了通信量,但在激进压缩下因忽略专家异质性而降低精度。我们提出了基于低秩补偿的带宽高效自适应混合专家模型,通过预计算的低秩补偿器执行路由引导的精度恢复。在推理时,我们的方法以Top-n(n<k)专家每标记的方式传输紧凑的低秩因子并对它们进行补偿,其余保持低位。集成到GPU和GPU-NDP系统上的卸载中,我们的方法提供了优越的带宽-精度权衡和提升的吞吐量。

关键词

引用

@article{arxiv.2512.17073,
  title  = {Bandwidth-Efficient Adaptive Mixture-of-Experts via Low-Rank Compensation},
  author = {Zhenyu Liu and Yunzhen Liu and Zehao Fan and Garrett Gagnon and Yayue Hou and Nan Wu and Yangwook Kang and Liu Liu},
  journal= {arXiv preprint arXiv:2512.17073},
  year   = {2025}
}