Astrea:基于MoE的渐进对齐视觉理解模型
计算机视觉与模式识别
2025-04-02 v2 人工智能
摘要
基于混合专家(MoE)架构的视觉语言模型(VLM)已成为多模态理解的关键范式,提供了一个强大的框架来整合视觉和语言信息。然而,任务日益增长的复杂性和多样性在协调异构视觉专家之间的负载均衡方面带来了显著挑战,其中优化某一专家的性能往往会损害其他专家的能力。为应对任务异构性和专家负载不平衡,我们提出了Astrea,一种基于渐进预对齐的新型多专家协作VLM架构。Astrea引入了三项关键创新:1) 异构专家协调机制,将四种专门模型(检测、分割、分类、描述)整合为覆盖基本视觉理解要素的综合专家矩阵;2) 动态知识融合策略,通过对比学习在VLM潜在空间中协调专家,并辅以概率激活的随机残差连接以保持知识连续性;3) 增强的优化框架,利用动量对比学习进行长程依赖建模,并利用自适应权重分配器进行实时专家贡献校准。在涵盖VQA、图像描述和跨模态检索的12项基准任务上的广泛评估证明了Astrea优于最先进模型,平均性能提升+4.7%。本研究首次实证证明了渐进预对齐策略能使VLM克服任务异构性限制,为开发通用多模态智能体建立了新的方法论基础。
引用
@article{arxiv.2503.09445,
title = {Astrea: A MOE-based Visual Understanding Model with Progressive Alignment},
author = {Xiaoda Yang and JunYu Lu and Hongshun Qiu and Sijing Li and Hao Li and Shengpeng Ji and Xudong Tang and Jiayang Xu and Jiaqi Duan and Ziyue Jiang and Cong Lin and Sihang Cai and Zejian Xie and Zhuoyang Song and Songxin Zhang},
journal= {arXiv preprint arXiv:2503.09445},
year = {2025}
}