中文

ZoomEye:通过基于树的图像探索增强类人式缩放能力的多模态LLM

计算机视觉与模式识别 2025-09-03 v4

摘要

多模态大语言模型(MLLM)在视觉语言理解方面展现出惊人的能力。近期,随着测试时扩张技术的集成,这些模型也在视觉推理方面显示出强大的潜力。然而,大多数现有推理方法仍局限于文本层面:MLLM通过其底层语言模型探索各种文本标记的组合,而视觉输入在整个推理过程中保持不变。这一范式限制了模型充分利用丰富视觉信息的能力,尤其是在处理包含众多细粒度元素的图像时。此时,视觉层面的推理变得至关重要——模型需要动态地缩放到图像的特定区域,以获取准确决策所必需的详细视觉线索。本文提出Zoom Eye,一种针对视觉层面推理的训练自由、模型无关的树搜索算法。Zoom Eye将图像视为层次结构的树,其中每个子节点代表其父子节点的放大子区域,根节点对应整个图像。该算法使MLLM能够通过从根节点导航到叶子节点,以寻找任务相关视觉证据来模拟人类的缩放行为。在一系列高分辨率基准测试上进行实验,结果表明Zoom Eye在多个MLLM上均以显著幅度提升性能(例如,InternVL2.5-8B在HR-Bench上提升了15.71%和17.69%),并且还能使小型3-8B MLLM超越诸如GPT-4o等强大大型模型。代码:https://github.com/om-ai-lab/ZoomEye

关键词

引用

@article{arxiv.2411.16044,
  title  = {ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration},
  author = {Haozhan Shen and Kangjia Zhao and Tiancheng Zhao and Ruochen Xu and Zilun Zhang and Mingwei Zhu and Jianwei Yin},
  journal= {arXiv preprint arXiv:2411.16044},
  year   = {2025}
}

备注

Accepted by EMNLP-2025 Main. Project page: https://szhanz.github.io/zoomeye/