CrowdFormer:具有改进泛化能力的弱监督人群计数
计算机视觉与模式识别
2022-03-09 v1
摘要
卷积神经网络(CNNs)近十年来因其强大的局部特征学习能力主导了计算机视觉领域。然而,由于其有限的感受野,CNNs无法建模全局上下文。另一方面,基于注意力的架构transformer可轻松建模全局上下文。尽管如此,探究transformers在人群计数中有效性的研究有限。此外,现有多数人群计数方法基于密度图回归,需要对场景中每个人进行点级标注。该标注任务费力且易错。这导致弱监督人群计数方法受到更多关注,其仅需计数级标注。本文中,我们提出一种使用金字塔视觉transformer的弱监督人群计数方法。我们进行了广泛评估以验证所提方法的有效性。我们的方法在基准人群数据集上与最先进的(SOTA)相当。更重要的是,其展现出卓越的泛化能力。
引用
@article{arxiv.2203.03768,
title = {CrowdFormer: Weakly-supervised Crowd counting with Improved Generalizability},
author = {Siddharth Singh Savner and Vivek Kanhangad},
journal= {arXiv preprint arXiv:2203.03768},
year = {2022}
}