Mixpert:利用高效的混合视觉专家缓解多模态学习冲突
计算机视觉与模式识别
2025-06-02 v1 人工智能
摘要
多模态大型语言模型(MLLM)需要对复杂图像信息进行细致入微的解读,通常利用视觉编码器来感知各种视觉场景。然而,仅依靠单个视觉编码器来处理多样化的任务领域被证明是困难的,并且不可避免地会导致冲突。最近的工作通过直接集成多个特定领域的视觉编码器来增强数据感知,但这种结构增加了复杂性并限制了联合优化的潜力。在本文中,我们引入了 Mixpert,这是一种高效的混合视觉专家架构,它继承了单个视觉编码器的联合学习优势,同时被重构为多专家范式,以便在不同视觉任务中进行特定任务的微调。此外,我们设计了一种动态路由机制,将输入图像分配给最合适的视觉专家。Mixpert 以极少的额外计算成本,有效缓解了单个视觉编码器在多任务学习中遇到的领域冲突,使其比多个编码器更高效。此外,Mixpert 可无缝集成到任何 MLLM 中,实验结果表明其在各种任务上均取得了显著的性能提升。
引用
@article{arxiv.2505.24541,
title = {Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts},
author = {Xin He and Xumeng Han and Longhui Wei and Lingxi Xie and Qi Tian},
journal= {arXiv preprint arXiv:2505.24541},
year = {2025}
}