中文

Taste More, Taste Better:多样化数据与强模型提升半监督人群计数

计算机视觉与模式识别 2025-03-25 v1 人工智能

摘要

半监督人群计数对于解决人口稠密场景中的高标注成本问题至关重要。尽管已提出若干基于伪标签的方法,但有效且准确地利用无标签数据仍具有挑战性。本文提出一种名为Taste More Taste Better(TMTB)的新型框架,强调数据和模型两个方面。首先,我们探索一种适用于人群计数任务的数据增强技术。通过对背景区域进行填充,这一技术能够有效提升数据多样性,同时保持整个场景的忠实度。其次,我们引入视觉状态空间模型(Visual State Space Model)作为骨干网络,以捕获人群场景中的全局上下文信息,这在极端拥挤、低光照和恶劣天气情境中至关重要。除了传统用于精确预测的回归头外,我们还采用反噪声分类头提供较不精确但更准确的监督,因为回归头对手动标注中的噪声敏感。我们在四个基准数据集上进行大量实验,表明该方法在SOTA方法上取得显著优势。代码可在 https://github.com/syhien/taste_more_taste_better 公开。

关键词

引用

@article{arxiv.2503.17984,
  title  = {Taste More, Taste Better: Diverse Data and Strong Model Boost Semi-Supervised Crowd Counting},
  author = {Maochen Yang and Zekun Li and Jian Zhang and Lei Qi and Yinghuan Shi},
  journal= {arXiv preprint arXiv:2503.17984},
  year   = {2025}
}

备注

Accepted by CVPR 2025