中文

SITUATE——用于视觉语言模型训练的空间约束目标计数数据集

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

我们提出了 SITUATE,这是一个新颖的数据集,旨在用于训练和评估具有空间约束的计数任务上的视觉语言模型。该数据集弥合了像 VLMCountBench 这样的简单 2D 数据集与像 TallyQA 这样通常模糊不清且缺乏对遮挡和空间组合控制的真实生活数据集之间的差距。实验表明,我们的数据集有助于提高对分布外图像的泛化能力,因为在 SITUATE 上微调 Qwen VL 2.5 7B 提高了在 Pixmo 计数测试数据上的准确性,反之则不然。我们通过将模型性能与已建立的其他计数基准以及从 Pixmo 计数导出的同等规模的微调集进行比较,来交叉验证这一点。

关键词

引用

@article{arxiv.2602.00108,
  title  = {SITUATE -- Synthetic Object Counting Dataset for VLM training},
  author = {René Peinl and Vincent Tischler and Patrick Schröder and Christian Groth},
  journal= {arXiv preprint arXiv:2602.00108},
  year   = {2026}
}

备注

accepted at 21st International Conference on Computer Vision Theory and Applications