中文

面向多模态大语言模型的密集连接器

计算机视觉与模式识别 2024-11-18 v2 人工智能

摘要

我们是否充分利用了多模态大语言模型(MLLMs)中视觉编码器的潜力?近期 MLLMs 在多模态理解方面的卓越表现引起了学术界和工业界的广泛关注。在当前 MLLM 的激烈竞争中,焦点似乎主要集中在语言侧。我们见证了更大、更高质量的指令数据集的兴起,以及更大规模 LLMs 的参与。然而,对于 MLLMs 所使用的视觉信号却鲜少受到关注,它们通常被假定为由冻结的视觉编码器提取的最终高层特征。在本文中,我们引入了密集连接器——一种简单、有效且即插即用的视觉-语言连接器,它通过利用多层视觉特征,在极少的额外计算开销下显著增强了现有的 MLLMs。在此基础上,我们还提出了高效密集连接器,仅使用 25% 的视觉 token 即可达到与 LLaVA-v1.5 相当的性能。此外,我们仅在图像上训练的模型在视频理解中也展现出卓越的零样本能力。在各种视觉编码器、图像分辨率、训练数据集规模、不同规模的 LLMs(2.7B->70B)以及多种 MLLM 架构(如 LLaVA-v1.5、LLaVA-NeXT 和 Mini-Gemini)上的实验结果验证了我们方法的通用性和可扩展性,在 19 个图像和视频基准上取得了 SOTA 性能。我们希望这项工作能提供有价值的经验,并作为未来 MLLM 发展的基础模块。代码可在 https://github.com/HJYao00/DenseConnector 获取。

关键词

引用

@article{arxiv.2405.13800,
  title  = {Dense Connector for MLLMs},
  author = {Huanjin Yao and Wenhao Wu and Taojiannan Yang and YuXin Song and Mengxi Zhang and Haocheng Feng and Yifan Sun and Zhiheng Li and Wanli Ouyang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2405.13800},
  year   = {2024}
}

备注

27 pages, NeurIPS 2024