中文

AFreeCA:面向全类的无标注计数

计算机视觉与模式识别 2024-08-05 v2

摘要

物体计数方法通常依赖于手动标注的数据集。创建此类数据集的成本限制了这些网络仅能计数特定类别的物体(如人类或企鹅),而计数不同类别的物体仍然是一个挑战。鲁棒的文本到图像潜在扩散模型 (LDMs) 的出现引发了一个问题:这些模型能否用于生成计数数据集?然而,LDMs 难以仅基于文本提示创建具有确切数量物体的图像,但它们可以通过在图像中添加和移除物体来提供可靠的排序信号。利用这些数据,我们首先引入了一种无监督排序方法来学习与物体相关的特征,随后利用 LDMs 生成的计数数据对这些特征进行细化和锚定以用于计数目的。此外,我们提出了一种密度分类器引导的方法,将图像划分为包含可可靠计数物体的补丁。因此,我们可以为任何类型的物体生成计数数据,并以无监督方式对它们进行计数。我们的方法优于其他无监督和少样本替代方案,且不受限于已有计数数据的特定物体类别。代码将在录用后发布。

关键词

引用

@article{arxiv.2403.04943,
  title  = {AFreeCA: Annotation-Free Counting for All},
  author = {Adriano D'Alessandro and Ali Mahdavi-Amiri and Ghassan Hamarneh},
  journal= {arXiv preprint arXiv:2403.04943},
  year   = {2024}
}