视觉注意力永不褪色:面向多模态大语言模型精细化图像描述的选择性渐进注意力重校准
计算机视觉与模式识别
2025-06-05 v2 人工智能
摘要
精细化图像描述对于数据生成和辅助视障人士等任务至关重要。高质量描述需要在精确率和召回率之间取得平衡,这对当前的多模态大语言模型(MLLMs)来说仍具挑战。在本工作中,我们假设这一限制源于随着回答变长,视觉注意力逐渐减弱且噪声增多。为解决此问题,我们提出了SPARC(选择性渐进注意力重校准),这是一种无需训练的方法,可在解码过程中增强视觉令牌的贡献。SPARC基于三个关键观察:(1)增加所有视觉令牌的影响会降低召回率;因此,SPARC选择性地放大视觉令牌;(2)随着描述变长,视觉注意力变得更嘈杂,因此SPARC通过利用跨时间步的注意力差异来识别关键的视觉令牌;(3)随着视觉注意力逐渐减弱,SPARC对其进行强化以保持其影响力。我们的实验结合了自动评估和人工评估,结果表明现有方法以牺牲召回率为代价提高了MLLMs的精确率。相比之下,我们提出的方法以最小的计算开销同时提升了精确率和召回率。
引用
@article{arxiv.2502.01419,
title = {Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models},
author = {Mingi Jung and Saehyung Lee and Eunji Kim and Sungroh Yoon},
journal= {arXiv preprint arXiv:2502.01419},
year = {2025}
}
备注
ICML 2025