头部感知视觉裁剪:基于注意力引导的子图像增强细粒度VQA
计算机视觉与模式识别
2026-02-02 v1
摘要
多模态大语言模型(MLLMs)在视觉问答(VQA)中表现出强大的性能,但由于低分辨率输入和噪声注意力聚合,仍受限于细粒度推理。我们提出一种名为Head Aware Visual Cropping(HAVC)的训练-free方法,通过利用选择性精炼的注意力头来提升视觉 grounding。HAVC首先通过OCR基准诊断任务筛选注意力头,确保仅保留那些具有真实 grounding 能力的头。推理时,这些头还利用空间熵进行更强的空间集中,并利用梯度敏感性进行预测贡献。融合这些信号可产生可靠的视觉裁剪引导图,从而突出显示最具任务相关性的区域,并指导裁剪出子图像随后提供给MLLM一起处理图像-问题对。大量实验表明,HAVC在多个细粒度VQA基准测试上均优于最先进的裁剪策略,实现更精确的局部化、更强的视觉 grounding,为增强MLLM的精度提供了一个简单而有效的策略。
引用
@article{arxiv.2601.22483,
title = {Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage},
author = {Junfei Xie and Peng Pan and Xulong Zhang},
journal= {arXiv preprint arXiv:2601.22483},
year = {2026}
}
备注
Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)