CoF:面向多模态大语言模型的粗粒度到细粒度图像理解
计算机视觉与模式识别
2024-12-24 v1
摘要
大型语言模型(LLM)的卓越性能促使研究者开发多模态LLM(MLLM),后者在various多模态任务中显示出巨大的潜力。然而,当前的MLLM常常难以有效解决细粒度多模态挑战。我们认为,这一限制与模型的视觉定位能力密切相关。视觉编码器受限的空间感知和感知锐度常常导致模型忽略图像中不相关的背景信息,从而导致模型忽略细微但至关重要的细节。最终难以实现细粒度的区域视觉理解。在本文中,我们将多模态理解分解为两个阶段,从粗到细(CoF)。在第一个阶段,我们提示MLLM定位答案的大致区域。在第二个阶段,我们通过视觉提示工程进一步增强模型对图像中相关区域的关注,通过调整关键区域的注意力权重。这反过来改善了视觉定位和下游任务的总体性能。我们的实验表明,该方法显著提升了基线模型的性能,显示出显著的泛化能力和有效性。我们的CoF方法已在https://github.com/Gavin001201/CoF上线。
引用
@article{arxiv.2412.16869,
title = {CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models},
author = {Yeyuan Wang and Dehong Gao and Bin Li and Rujiao Long and Lei Yi and Xiaoyan Cai and Libin Yang and Jinxia Zhang and Shanqing Yu and Qi Xuan},
journal= {arXiv preprint arXiv:2412.16869},
year = {2024}
}
备注
5 pages, Accepted by ICASSP2025, full paper