中文

VisMMOE:基于视觉-专家亲和性的高效视觉-语言混合专家卸载

机器学习 2026-05-08 v1

摘要

大规模视觉-语言混合专家(VL-MoE)模型提供了强大的多模态能力,但在内存受限的平台上实现高效部署仍然具有挑战性。现有的 MoE 卸载系统主要为文本导向 workloads 设计,对视觉密集型输入效果大幅下降,因为大量视觉 token 会诱发更广泛且不可预测的 expert 访问。我们提出了 VisMMoE,一种基于单一系统洞察的 VL-MoE 卸载系统:对冗余视觉 token 进行剪枝可提升卸载效果,不仅通过减少计算量,还通过重塑 expert 需求。我们称这种效应为视觉-专家亲和性:token 剪枝使 expert 访问在层内更集中,在层间更稳定,从而产生更小且更可预测的 expert 工作集。基于此洞察,VisMMoE 结合了亲和感感知的 token 压缩、 lookahead expert 预测以及 cache/pipeline 编排,以提升 expert 局部性和预取效果,在紧张的内存预算下实现高效运行。我们在多个框架上实现了 VisMMoE,并在代表性 VL-MoE 模型和基准测试上进行评估。VisMMoE 在当今 VL-MoE 部署的强基准之上,分别实现了最高达 2.68 倍和 1.61 倍的端到端推理性能提升,同时保持了具竞争力的准确率。

关键词

引用

@article{arxiv.2605.05899,
  title  = {VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading},
  author = {Cheng Xu and Xiaofeng Hou and Jiacheng Liu and Chao Li},
  journal= {arXiv preprint arXiv:2605.05899},
  year   = {2026}
}