基于视频的人群估计中具有不确定匹配的时空扩张卷积
计算机视觉与模式识别
2021-02-01 v1 机器学习
摘要
在本文中,我们提出了一种新颖的时空卷积稠密网络(STDNet)来解决基于视频的人群计数问题,该网络包含3D卷积的分解和3D时空扩张稠密卷积,以缓解Conv3D层引起的模型规模快速增长。此外,由于扩张卷积提取多尺度特征,我们将扩张卷积与通道注意力块结合以增强特征表示。由于标注人群(尤其是视频)困难所产生的误差,不精确或标准不一致的标签可能导致模型收敛性差。为解决此问题,我们进一步提出了一种新的块级回归损失(PRL)以改进原有的像素级损失。在三个基于视频的基准(即UCSD、Mall和WorldExpo'10数据集)上的实验结果表明,STDNet优于基于图像和基于视频的最先进方法。源代码发布于\url{https://github.com/STDNet/STDNet}。
引用
@article{arxiv.2101.12439,
title = {Spatiotemporal Dilated Convolution with Uncertain Matching for Video-based Crowd Estimation},
author = {Yu-Jen Ma and Hong-Han Shuai and Wen-Huang Cheng},
journal= {arXiv preprint arXiv:2101.12439},
year = {2021}
}
备注
Accepted by IEEE Transactions on Multimedia, 2021 (https://ieeexplore.ieee.org/document/9316927)