CCTrans:利用 Transformer 简化与改进人群计数
计算机视觉与模式识别
2021-09-30 v1
摘要
最近用于人群计数的大多数方法基于卷积神经网络(CNN),其具有很强的局部特征提取能力。但由于感受野有限,CNN 在建模全局上下文方面存在固有缺陷。然而,Transformer 可以轻松建模全局上下文。在本文中,我们提出了一种名为 CCTrans 的简单方法来简化设计流程。具体而言,我们利用金字塔视觉 Transformer 主干网络捕获全局人群信息,利用金字塔特征聚合(PFA)模型结合低层和高层特征,并利用具有多尺度空洞卷积(MDC)的高效回归头来预测密度图。此外,我们为我们的流程量身定制了损失函数。无需繁杂的技巧,大量实验表明,我们的方法在弱监督和全监督人群计数的多个基准测试上均取得了新的 SOTA 结果。此外,我们目前在 NWPU-Crowd 排行榜上排名第一。我们的代码将予以公开。
引用
@article{arxiv.2109.14483,
title = {CCTrans: Simplifying and Improving Crowd Counting with Transformer},
author = {Ye Tian and Xiangxiang Chu and Hongpeng Wang},
journal= {arXiv preprint arXiv:2109.14483},
year = {2021}
}