用于人群计数的增强三维卷积网络
计算机视觉与模式识别
2019-08-13 v1
摘要
近来,卷积神经网络(CNNs)是人群计数事实上的领先方法。然而,在处理视频数据集时,基于 CNN 的方法仍独立地处理每一视频帧,从而忽略了连续帧之间强大的时间信息。本工作中,我们提出一种称为“时间通道感知”(TCA)块的新型架构,其具备利用视频序列间时间相互依赖关系的能力。具体而言,我们引入三维卷积核以编码局部时空特征。此外,全局上下文信息被编码为调制权重,自适应地重校准通道感知特征响应。结合局部与全局上下文,所提块增强了特征表示的判别能力,并有助于在多样场景中取得更精确的结果。通过堆叠 TCA 块,我们得到称为增强三维卷积网络(E3D)的深度可训练架构。在三个基准数据集上的实验表明,所提方法取得了最先进的性能。为验证通用性,在车辆数据集 TRANCOS 上进行了扩展实验,我们的方法大幅优于先前方法。
引用
@article{arxiv.1908.04121,
title = {Enhanced 3D convolutional networks for crowd counting},
author = {Zhikang Zou and Huiliang Shao and Xiaoye Qu and Wei Wei and Pan Zhou},
journal= {arXiv preprint arXiv:1908.04121},
year = {2019}
}
备注
Accepted to BMVC 2019