中文

基于语言-视觉模型的零样本物体计数

计算机视觉与模式识别 2023-09-26 v1

摘要

类无关物体计数旨在测试时对任意类别的物体实例进行计数。该任务具有挑战性,但也催生诸多潜在应用。现有方法需以人工标注的样本作为输入,而对于新颖类别(尤其对自主系统而言)往往难以获取。因此,我们提出零样本物体计数(ZSC),一种测试时仅提供类别名称的新设定。这免除了人工标注需求并支持自动化运行。为执行 ZSC,我们提出从输入图像中找出若干物体裁剪块并用作计数样本。目标是识别包含感兴趣物体的图像块,同时使其在视觉上能代表图像中所有实例。为此,我们首先利用包括 CLIP 与 Stable Diffusion 在内的语言-视觉大模型构建类别原型,以筛选含目标物体的图像块。此外,我们提出一种排序模型,估计每块计数误差,从而选取最适合作计数的样本。在近期类无关计数数据集 FSC-147 上的实验结果验证了本方法的有效性。

关键词

引用

@article{arxiv.2309.13097,
  title  = {Zero-Shot Object Counting with Language-Vision Models},
  author = {Jingyi Xu and Hieu Le and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2309.13097},
  year   = {2023}
}

备注

Extended version of CVPR23 arXiv:2303.02001 . Currently under review at T-PAMI