INF-LLaVA:用于高分辨率多模态大语言模型的双视角感知
计算机视觉与模式识别
2024-07-24 v1 人工智能
摘要
随着数据可用性和计算资源的提升,多模态大语言模型 (MLLM) 在 various fields 中展现出广泛能力。然而,视觉编码器的二次复杂度限制了输入图像的分辨率。大多数现有方法通过裁剪高分辨率图像为多个小子图像来缓解此问题,这些子图像由视觉编码器独立处理。尽管捕获了足够的局部细节,这些子图像缺乏全局上下文且彼此之间无法相互作用。为解决这一限制,我们提出了一种 novel MLLM,即 INF-LLaVA,专为有效的高分辨率图像感知而设计。INF-LLaVA 包含两个创新组件。首先,我们引入双视角裁剪模块 (DCM),确保每个子图像包含来自局部视角的连续细节和来自全局视角的综合信息。其次,我们引入双视角增强模块 (DEM),以实现全局和局部特征的相互增强,使 INF-LLaVA 能够通过同时捕获详细的局部信息和综合的全局上下文来有效处理高分辨率图像。广泛的消融研究验证了这些组件的有效性,在多样化的基准测试上进行的实验表明,INF-LLaVA 超越了现有的 MLLMs。代码和预训练模型可在 https://github.com/WeihuangLin/INF-LLaVA 查看。
引用
@article{arxiv.2407.16198,
title = {INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model},
author = {Yiwei Ma and Zhibin Wang and Xiaoshuai Sun and Weihuang Lin and Qiang Zhou and Jiayi Ji and Rongrong Ji},
journal= {arXiv preprint arXiv:2407.16198},
year = {2024}
}