中文

AsyMoE:利用模态不对称性增强大型视觉-语言模型中的专家专业化

计算机视觉与模式识别 2025-12-23 v2 机器人学

摘要

大型视觉-语言模型(LVLMs)通过扩展架构和广泛训练,在多模态任务上展现了令人印象深刻的性能。然而,现有的专家混合(MoE)方法由于视觉和语言处理之间的不对称性而面临挑战。视觉信息在空间上是完整的,而语言则需要保持顺序上下文。因此,MoE模型难以平衡模态特定特征和跨模态交互。通过系统分析,我们观察到深层中的语言专家逐渐失去上下文基础,更多地依赖参数化知识,而不是利用提供的视觉和语言信息。为了解决这个问题,我们提出了AsyMoE,这是一种新颖的架构,它使用三个专门的专家组来对这种不对称性进行建模。我们设计了用于模态特定处理的模态内专家,用于分层跨模态交互的双曲跨模态专家,以及用于抑制参数偏差并维持上下文基础的证据优先语言专家。大量实验表明,与普通MoE和模态特定MoE相比,AsyMoE的准确率分别提高了26.58%和15.45%,且激活参数比稠密模型少25.45%。

关键词

引用

@article{arxiv.2509.12715,
  title  = {AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models},
  author = {Heng Zhang and Haichuan Hu and Yaomin Shen and Weihao Yu and Yilei Yuan and Haochen You and Guo Cheng and Zijian Zhang and Lubin Gan and Huihui Wei and Hao Zhang and Jin Huang},
  journal= {arXiv preprint arXiv:2509.12715},
  year   = {2025}
}

备注

This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results