Manager:在双塔视觉语言模型和多模态大语言模型中聚合单模态专家的洞察
摘要
双塔视觉语言模型(VLMs)在各种下游视觉语言任务中展现了强大的性能。尽管 BridgeTower 通过在编码器之间建立桥梁进一步提升了性能,但它 (i) 未能有效逐层利用单模态表示,(ii) 限制了对不同层级单模态语义知识的灵活利用,且 (iii) 仅局限于在传统低分辨率数据集上使用双塔 VLM 架构进行评估。在本工作中,我们提出 Manager,一个轻量、高效且有效的插件,能够自适应地聚合来自不同层级的预训练单模态专家的洞察,以促进更全面的视觉语言对齐与融合。首先,在双塔 VLM 架构下,我们引入 ManagerTower,一种新型视觉语言模型,在每个跨模态层中引入管理器。无论是否经过视觉语言预训练,ManagerTower 均优于之前的强基线,并在 4 个下游视觉语言任务上取得了优越性能。此外,我们将探索扩展到最新的多模态大语言模型(MLLM)架构。我们证明 LLaVA-OV-Manager 在 20 个下游数据集上显著提升了 LLaVA-OV 的零样本性能,涵盖不同能力类别、图像类型和分辨率,无论是否启用多网格算法。深入分析表明,我们的管理器和多网格算法均可被视为一种插件,通过从两个正交视角(深度和宽度)捕获更多样化的视觉细节来提升视觉表示。它们的协同作用可以缓解多网格算法引起的语义模糊,并进一步提升性能。代码和模型可在 https://github.com/LooperXX/ManagerTower 获取。
引用
@article{arxiv.2506.11515,
title = {Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs},
author = {Xiao Xu and Libo Qin and Wanxiang Che and Min-Yen Kan},
journal= {arXiv preprint arXiv:2506.11515},
year = {2025}
}
备注
Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). June 2025. DOI: https://doi.org/10.1109/TCSVT.2025.3578266