中文

基于视频的人群估计中具有不确定匹配的时空扩张卷积

计算机视觉与模式识别 2021-02-01 v1 机器学习

摘要

在本文中,我们提出了一种新颖的时空卷积稠密网络(STDNet)来解决基于视频的人群计数问题,该网络包含3D卷积的分解和3D时空扩张稠密卷积,以缓解Conv3D层引起的模型规模快速增长。此外,由于扩张卷积提取多尺度特征,我们将扩张卷积与通道注意力块结合以增强特征表示。由于标注人群(尤其是视频)困难所产生的误差,不精确或标准不一致的标签可能导致模型收敛性差。为解决此问题,我们进一步提出了一种新的块级回归损失(PRL)以改进原有的像素级损失。在三个基于视频的基准(即UCSD、Mall和WorldExpo'10数据集)上的实验结果表明,STDNet优于基于图像和基于视频的最先进方法。源代码发布于\url{https://github.com/STDNet/STDNet}。

关键词

引用

@article{arxiv.2101.12439,
  title  = {Spatiotemporal Dilated Convolution with Uncertain Matching for Video-based Crowd Estimation},
  author = {Yu-Jen Ma and Hong-Han Shuai and Wen-Huang Cheng},
  journal= {arXiv preprint arXiv:2101.12439},
  year   = {2021}
}

备注

Accepted by IEEE Transactions on Multimedia, 2021 (https://ieeexplore.ieee.org/document/9316927)