基于膨胀卷积Swin Transformer的拥挤人群实例定位
计算机视觉与模式识别
2021-08-03 v1
摘要
人群定位是一项由人群计数演化而来的计算机视觉新任务。与后者不同,它为每个实例提供更精确的位置信息,而非仅给出整幅人群场景的计数,这带来了更大的挑战,尤其在极度拥挤的人群场景中。本文关注如何在高密度人群场景中实现精确的实例定位,并缓解因目标遮挡、图像模糊等导致传统模型特征提取能力退化的问题。为此,我们提出了一种面向拥挤人群场景的膨胀卷积Swin Transformer(DCST)。具体而言,将基于窗口的视觉Transformer引入人群定位任务,有效提升了表征学习能力;随后,精心设计的膨胀卷积模块被插入该Transformer的不同阶段以增强大范围上下文信息。大量实验证明了所提方法的有效性,并在五个常用数据集上取得了最先进的性能。特别地,所提模型在定位与计数性能上分别取得了 77.5% 的 F1-measure 与 84.2 的 MAE。
引用
@article{arxiv.2108.00584,
title = {Congested Crowd Instance Localization with Dilated Convolutional Swin Transformer},
author = {Junyu Gao and Maoguo Gong and Xuelong Li},
journal= {arXiv preprint arXiv:2108.00584},
year = {2021}
}
备注
10 pages, 4 figures