MoCHA:基于MoE连接器和层次化群注意力的高级视觉-语言推理
计算机视觉与模式识别
2025-11-18 v3 人工智能
摘要
视觉大语言模型(VLLM)主要专注于通过融合高级视觉编码器和扩大视觉模型来处理复杂细粒度视觉信息。然而,这些方法面临高昂的训练和推理成本,以及从视觉细节中有效提取信息、跨模态衔接的挑战。本 work提出了一种新型视觉框架MoCHA,以解决上述问题。我们的框架集成了四个视觉主干网络(即CLIP、SigLIP、DINOv2和ConvNeXt)以提取互补视觉特征,并配备稀疏Mixture of Experts连接器(MoECs)模块,以动态选择针对不同视觉维度的专家。为缓解MoECs模块编码视觉信息的冗余或不足使用问题,我们进一步设计了具有内群操作和群间操作的层次化群注意力(HGA),并为编码视觉特征引入自适应门控策略。我们在两种主流LLM(例如Phi2-2.7B和Vicuna-7B)上训练MoCHA,并在各种基准测试上对其性能进行评估。值得注意的是,MoCHA在各种任务上均超越了现有SOTA开源权重模型。例如,与CuMo(Mistral-7B)相比,我们的MoCHA(Phi2-2.7B)在减轻幻觉方面表现突出,POPE提升了3.25%;在遵循视觉指令方面,在MME上提升了153分。最后,消融研究进一步确认了所提出的MoECs和HGA在提高MoCHA整体性能方面的有效性和鲁棒性。
引用
@article{arxiv.2507.22805,
title = {MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention},
author = {Yuqi Pang and Bowen Yang and Yun Cao and Rong Fan and Xiaoyu Li and Chen He},
journal= {arXiv preprint arXiv:2507.22805},
year = {2025}
}