通过提升视觉能力来改进多模态大语言模型
计算机视觉与模式识别
2024-10-18 v1 多媒体
摘要
我们聚焦于提升视觉理解能力以增强视觉语言模型。我们提出了 Arcana—a 一种多模态语言模型,引入了两个关键技术。首先,我们提出了多模态 LoRA (MM-LoRA),一种旨在增强解码器的模块。不同于传统语言驱动的解码器,MM-LoRA 由两个平行的 LoRA 组成——一个用于视觉,一个用于语言——各自具有自己的参数。这种解耦参数设计允许每个模态进行更专业的学习,并更好地集成多模态信息。其次,我们引入了查询梯子适配器 (QLadder) 以改进视觉编码器。QLadder 采用可学习的“梯子”结构深入地整合了来自冻结预训练视觉编码器(例如 CLIP 图像编码器)的中间表示。这使模型能够学习新的和有信息的视觉特征,同时保持预训练视觉编码器的强大能力。这些技术共同增强了 Arcana 的视觉感知能力,使其能够利用改进的视觉信息,在各种多模态场景中实现更准确、更具上下文相关性的输出。广泛的实验和消融研究表明了我们 Arcana 的有效性和通用性。代码和重新标注的数据可在 \url{https://arcana-project-page.github.io} 获取。
引用
@article{arxiv.2410.13733,
title = {Improving Multi-modal Large Language Model through Boosting Vision Capabilities},
author = {Yanpeng Sun and Huaxin Zhang and Qiang Chen and Xinyu Zhang and Nong Sang and Gang Zhang and Jingdong Wang and Zechao Li},
journal= {arXiv preprint arXiv:2410.13733},
year = {2024}
}