中文

MLLM 知道看向何处:利用多模态 LLM 对微小视觉细节的免训练感知

计算机视觉与模式识别 2025-02-25 v1 人工智能 计算与语言

摘要

近年来,多模态大型语言模型(MLLM)在视觉识别任务中取得了快速进展。鉴于其可能被集成到许多关键应用中,理解其视觉感知的局限性十分重要。在本工作中,我们研究了 MLLM 在回答关于图像的问题时,能否像感知大视觉细节那样有效地感知微小的视觉细节。我们观察到,它们的性能对问题所涉视觉主体的大小非常敏感,并通过一项干预研究进一步表明,这种影响实际上是因果性的。接下来,我们研究了 MLLM 在回答视觉问题时的注意力模式,并有趣地发现,即使它们给出错误答案,也始终知道应该看向哪里。基于这些发现,我们随后提出了免训练的视觉干预方法,该方法利用任何 MLLM 自身的内部知识(以注意力图和梯度图的形式),来增强其对微小视觉细节的感知。我们在两个广泛使用的 MLLM 和七个视觉问答基准上评估了所提出的方法,结果表明它们无需任何训练即可显著提高 MLLM 的准确率。我们的结果阐明了将 MLLM 应用于涉及微小细节的视觉识别任务的风险,并表明利用模型内部状态进行视觉干预是缓解此风险的一个有前景的方向。

关键词

引用

@article{arxiv.2502.17422,
  title  = {MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs},
  author = {Jiarui Zhang and Mahyar Khayatkhoei and Prateek Chhikara and Filip Ilievski},
  journal= {arXiv preprint arXiv:2502.17422},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025. Code at: https://github.com/saccharomycetes/mllms_know