中文

像素级精度的推理:用于定量地理空间分析的 QVLM 架构与 SQuID 数据集

计算机视觉与模式识别 2026-01-21 v1 人工智能

摘要

当前的视觉语言模型在定量空间推理方面表现不佳,因为其架构破坏了计数和测量所需的像素级信息。视觉编码器通过 patch 嵌入压缩图像,减少了空间索引并丢失了精确计数所需的像素级追踪。我们提出两项贡献以解决这一根本限制。首先,我们引入了 SQuID(Satellite Quantitative Intelligence Dataset),这是一个包含 2000 个卫星图像问答对的基准数据集,带有数值范围和类别答案,旨在评估定量空间推理能力。该数据集涵盖三个难度层级,其标注由人类标签及其学习到的变异性自动生成。其次,我们提出了 QVLM(Quantitative Vision-Language Model),一种代码生成架构,通过将语言理解与视觉分析解耦来保持像素精度。QVLM 不将图像编码为嵌入,而是生成可执行代码,首先调用分割模型获取像素级掩码,然后直接在这些掩码上进行操作,从而在整个推理过程中保持空间索引。我们的实验表明,使用 GPT-5 作为编码器的 QVLM 在 SQuID 上的准确率达到 42.0%,而使用图像-问题对提示的 VLM 仅为 28.1%。我们的工作表明,对于定量空间推理,架构解耦能够在定量任务上实现更高的准确率。

关键词

引用

@article{arxiv.2601.13401,
  title  = {Reasoning with Pixel-level Precision: QVLM Architecture and SQuID Dataset for Quantitative Geospatial Analytics},
  author = {Peter A. Massih and Eric Cosatto},
  journal= {arXiv preprint arXiv:2601.13401},
  year   = {2026}
}

备注

Submitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565