CrowdCLIP:基于视觉-语言模型的无监督人群计数
计算机视觉与模式识别
2023-04-11 v1
摘要
有监督人群计数严重依赖昂贵的人工标注,这在密集场景中尤为困难且成本高昂。为缓解该问题,我们提出了一种新颖的无监督人群计数框架,名为 CrowdCLIP。其核心思想基于两点观察:1)近期对比预训练的视觉-语言模型(CLIP)在各种下游任务上展现出令人印象深刻的性能;2)人群图像块与计数文本之间存在自然映射。据我们所知,CrowdCLIP 是首个利用视觉-语言知识解决计数问题的工作。具体而言,在训练阶段,我们通过构建排序文本提示,将按尺寸排序的人群图像块进行匹配,利用多模态排序损失来引导图像编码器学习。在测试阶段,为应对图像块的多样性,我们提出一种简单而有效的渐进式过滤策略,先筛选出高潜力人群图像块,再将其映射到具有不同计数区间的语言空间中。在五个具有挑战性的数据集上的大量实验表明,所提出的 CrowdCLIP 相较于以往无监督最优(SOTA)计数方法取得了更优性能。值得注意的是,在跨数据集设定下,CrowdCLIP 甚至超越了一些流行的全监督方法。源代码将发布于 https://github.com/dk-liang/CrowdCLIP。
引用
@article{arxiv.2304.04231,
title = {CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model},
author = {Dingkang Liang and Jiahao Xie and Zhikang Zou and Xiaoqing Ye and Wei Xu and Xiang Bai},
journal= {arXiv preprint arXiv:2304.04231},
year = {2023}
}
备注
Accepted by CVPR 2023