中文

UR-Bench:用于超高分辨率图像多跳推理的基准

计算机视觉与模式识别 2026-01-14 v1 人工智能

摘要

最近的多模态大语言模型(MLLM)在视觉语言推理方面表现出强大的能力,但在超高分辨率图像上的表现仍鲜有探索。现有的视觉问答(VQA)基准通常依赖中等分辨率数据,提供的视觉复杂度有限。为弥合这一差距,我们引入了超高分辨率推理基准(UR-Bench),用于评估MLLM在极端视觉信息下的推理能力。UR-Bench包含两个主要类别:人文场景和自然场景,涵盖四个超高分辨率图像子集,具有不同的空间结构和数据来源。每个子集包含从数百兆像素到吉像素不等的图像,配以分为三个等级的问题,使模型能够在超高分辨率情景下评估推理能力。我们进一步提出了基于代理的框架,语言模型通过调用外部视觉工具来进行推理。我们还引入了语义抽象与检索工具,以实现对超高分辨率图像的更高效处理。我们使用端到端MLLM和我们的代理框架对最先进的模型进行评估,证明了该框架的有效性。

关键词

引用

@article{arxiv.2601.08748,
  title  = {UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images},
  author = {Siqi Li and Xinyu Cai and Jianbiao Mei and Nianchen Deng and Pinlong Cai and Licheng Wen and Yufan Shen and Xuemeng Yang and Botian Shi and Yong Liu},
  journal= {arXiv preprint arXiv:2601.08748},
  year   = {2026}
}

备注

10 pages, 5 figures