中文

寻找图像中的细节:多模态大语言模型能否定位精细信息?

计算机视觉与模式识别 2025-08-08 v1

摘要

尽管多模态大语言模型(MLLMs)在文档理解任务中展现出惊人的能力,但其在复杂文档中定位和推理细粒度细节的能力仍受到 insufficient 研究。考虑到在搜索餐厅菜单中的特定营养细节或在冗长报纸文章中识别免责声明等任务,需要仔细关注更广阔叙事背景下的小而重要细节,这类任务类似于在图像中寻找针尖(Finding Needles in Images, NiM)。为此,我们引入NiM,这是一个精心筛选的基准数据集,涵盖多种真实世界文档,包括报纸、菜单和讲义图像,旨在评估MLLMs在这些复杂任务中的能力。基于此,我们进一步提出了Spot-IT方法,通过智能 patch 选择和高斯注意力机制来增强MLLMs的能力,灵感来自人类在搜索文档时进行放大和聚焦的方式。我们的大量实验揭示了当前MLLMs在处理细粒度文档理解任务方面的能力与局限,同时展示了我们方法的有效性。Spot-IT在需要从复杂布局中提取精确细节的场景中,相较于基线方法实现了显著提升。

关键词

引用

@article{arxiv.2508.05053,
  title  = {Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?},
  author = {Parth Thakkar and Ankush Agarwal and Prasad Kasu and Pulkit Bansal and Chaitanya Devaguptapu},
  journal= {arXiv preprint arXiv:2508.05053},
  year   = {2025}
}

备注

Accepted at ACL 2025 in the main track