中文

通过训练-free 融合提升多模态 LLM 的感知能力

计算机视觉与模式识别 2024-12-05 v2 人工智能

摘要

多模态 LLM(MLLM)通过将视觉编码器与语言模型对齐来为语言模型赋予视觉能力。现有的增强 MLLM 视觉感知的方法常涉及设计更强大的视觉编码器,这需要探索广泛的设计空间并对每种潜在编码器与语言模型进行重新对齐,导致训练成本极高。本文引入了 VisionFuse,这是一个 novel 的集成框架,有效利用来自现成 MLLM 的多个视觉编码器,以无需额外训练的方式提升视觉感知。我们受到以下观察的启发:不同的 MLLM 对同一查询和图像倾向于关注不同的区域。此外,我们发现 MLLM 家族中,视觉编码器的特征分布高度一致——这些 MLLM 共享相同的预训练 LLM。基于这些洞见,VisionFuse 通过拼接所选 MLLM 家族中视觉编码器生成的标记,丰富了视觉上下文。通过合并这些 MLLM 的语言模型参数,VisionFuse 允许单个语言模型与各种视觉编码器对齐,显著减少部署开销。我们在多个多模态基准测试上进行了全面评估,使用 various MLLM 组合,显示出在多模态任务上的显著性能提升。值得注意的是,在整合 MiniGemini-8B 和 SLIME-8B 时,VisionFuse 实现了超过 4% 的平均性能提升。

关键词

引用

@article{arxiv.2412.01289,
  title  = {Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion},
  author = {Zhuokun Chen and Jinwu Hu and Zeshuai Deng and Yufeng Wang and Bohan Zhuang and Mingkui Tan},
  journal= {arXiv preprint arXiv:2412.01289},
  year   = {2024}
}