中文

CLIP-Count:面向文本引导的零样本目标计数

计算机视觉与模式识别 2023-08-11 v2 人工智能

摘要

视觉-语言模型的最新进展展现出可迁移至目标检测与分割等下游任务的显著零样本文本-图像匹配能力。然而,将这些模型适配于目标计数仍是一项艰巨挑战。本研究首先探讨将视觉-语言模型(VLMs)迁移用于类无关目标计数。具体而言,我们提出 CLIP-Count,首个以零样本方式在文本引导下为开放词汇目标估计密度图的端到端流水线。为将文本嵌入与稠密视觉特征对齐,我们引入块-文本对比损失以引导模型学习用于稠密预测的信息性块级视觉表示。此外,我们设计分层块-文本交互模块以在不同分辨率层次的视觉特征间传播语义信息。得益于对预训练 VLMs 丰富图像-文本对齐知识的充分利用,我们的方法有效生成感兴趣目标的高质量密度图。在 FSC-147、CARPK 与 ShanghaiTech 人群计数数据集上的大量实验证明了所提方法的最先进(state-of-the-art, SOTA)精度与泛化性。代码见:https://github.com/songrise/CLIP-Count。

关键词

引用

@article{arxiv.2305.07304,
  title  = {CLIP-Count: Towards Text-Guided Zero-Shot Object Counting},
  author = {Ruixiang Jiang and Lingbo Liu and Changwen Chen},
  journal= {arXiv preprint arXiv:2305.07304},
  year   = {2023}
}

备注

Accepted by ACM MM 2023