中文

HRScene:视觉大语言模型在高分辨率图像理解方面离有效水平有多远?

计算与语言 2025-04-30 v2

摘要

高分辨率图像(HRI)理解旨在处理包含大量像素的图像,如病理图像和农业航空图像,后者的像素数可超过100万。虽然视觉大语言模型(VLMs)据称能够处理HRI,但缺乏对VLMs进行HRI理解评估的全面基准测试。为填补这一空白,我们引入HRScene——一个用于HRI理解的新型统一基准测试,包含丰富的场景。HRScene整合了25个真实数据集和2个合成诊断数据集,分辨率范围从1,024乘以1,024到35,503乘以26,627。HRScene由10名研究生级标注员收集并重新标注,覆盖25种场景,包括显微镜图像、放射学图像、街道景观、远距离照片以及天文照片。其中的HRI包括真实物体、扫描文档以及复合多图像。这两个诊断评估数据集通过将目标图像与金标准答案以及干扰图像以不同顺序组合而合成,评估模型如何有效利用HRI中的区域。我们对28个VLMs(包括Gemini 2.0 Flash和GPT-4o)进行了大规模实验。HRScene上的实验表明,当前VLMs在真实任务上的平均准确率约为50%,揭示了HRI理解方面的重大差距。合成数据集的结果表明,VLMs在有效利用HRI区域方面存在困难,显示出显著的区域分散现象和“失中焦”问题,为未来研究指明了方向。

关键词

引用

@article{arxiv.2504.18406,
  title  = {HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?},
  author = {Yusen Zhang and Wenliang Zheng and Aashrith Madasu and Peng Shi and Ryo Kamoi and Hao Zhou and Zhuoyang Zou and Shu Zhao and Sarkar Snigdha Sarathi Das and Vipul Gupta and Xiaoxin Lu and Nan Zhang and Ranran Haoran Zhang and Avitej Iyer and Renze Lou and Wenpeng Yin and Rui Zhang},
  journal= {arXiv preprint arXiv:2504.18406},
  year   = {2025}
}

备注

22 pages, 8 figures