FOCUS:利用多模态大语言模型内部表示实现高效细粒度视觉问答
计算机视觉与模式识别
2025-10-30 v2
摘要
尽管多模态大语言模型(MLLM)对图像-文本输入具有强大的感知和推理能力,但关注图像微小细节的视觉问答(VQA)仍然是一个挑战。虽然视觉裁剪技术看似有前景,但近期的方法存在若干局限性:需要特定任务的微调、由于无信息的穷举搜索导致效率低下,或与高效的注意力实现不兼容。我们通过提出一种无需训练的视觉裁剪方法(称为FOCUS)来解决这些缺点,该方法利用MLLM内部表示来引导搜索最相关的图像区域。这通过四个步骤完成:首先,识别VQA提示中的目标对象;其次,使用键值(KV)缓存计算对象相关性图;第三,基于该图提出并排序相关图像区域;最后,使用排名最高的区域执行细粒度VQA任务。由于这种有信息的搜索策略,FOCUS在四个细粒度VQA数据集和三种类型的MLLM上均取得了强劲性能。它在准确性和效率上均优于三种流行的视觉裁剪方法,并与最佳基线方法ZoomEye性能相当,同时所需计算量减少3至6.5倍。
引用
@article{arxiv.2506.21710,
title = {FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering},
author = {Liangyu Zhong and Fabio Rosenthal and Joachim Sicking and Fabian Hüger and Thorsten Bagdonat and Hanno Gottschalk and Leo Schwinn},
journal= {arXiv preprint arXiv:2506.21710},
year = {2025}
}
备注
Accepted by NeurIPS 2025 - main track. Project page: https://focus-mllm-vqa.github.io/