中文

UHR-Micro:诊断与缓解地球观测视觉语言模型中的分辨率错觉

计算机视觉与模式识别 2026-05-13 v1

摘要

视觉语言模型(VLM)日益用于超高分辨率(UHR)地球观测图像,但它们仍面临大规模场景上下文与微小目标之间严重的尺度不匹配问题。我们将这一经验性差距称为“分辨率错觉”:更高的输入分辨率提供更丰富的视觉细节的外观,但并不一定能可靠地感知与任务相关的微小空间目标。为评估这一挑战,我们引入UHR-Micro基准数据集,包含11,253条基于1,212幅UHR图像的指令,旨在评估视觉语言模型在地球观测图像空间极限上的表现。UHR-Micro涵盖多样化的微目标尺度、上下文要求、任务家族和视觉条件,提供诊断性标注,支持受控评估和细粒度错误归因。使用代表性高分辨率VLM进行实验显示,在获取高分辨率输入后,空间定位和证据解析仍存在显著失败,尽管模型容量增加无法完全解决这些问题,仅仅增加模型容量仍与在定位和使用任务相关微证据方面的不足密切相关。针对这一发现,我们提出了微证据主动感知(Micro-evidence Active Perception, MAP),一种参考代理, 将查询分解为证据寻求步骤,主动检查候选区域,并以局部观察为依据来定位答案。MAP代理通过使高分辨率推理变为以证据为中心而非以图像为中心,提高了微观感知能力。总之,UHR-Micro和MAP代理为评估、理解和推进地球观测视觉语言模型中的高分辨率推理提供了诊断平台。数据集和源代码已发布于 https://github.com/MiliLab/UHR-Micro。

关键词

引用

@article{arxiv.2605.12237,
  title  = {UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs},
  author = {Shuo Ni and Tong Wang and Jing Zhang and He Chen and Haonan Guo and Ning Zhang and Bo Du},
  journal= {arXiv preprint arXiv:2605.12237},
  year   = {2026}
}