中文

用于视频人群计数的局部约束空间变换网络

计算机视觉与模式识别 2019-07-19 v1

摘要

与基于单图像的人群计数相比,视频提供了人群的空间-时间信息,有助于提升人群计数的鲁棒性。但人物的平移、旋转和缩放导致相邻帧间头部密度图发生变化。同时,动态场景中人物的走入/走出或被遮挡导致头部数量发生变化。为缓解视频人群计数中的这些问题,本文提出一种局部约束空间变换网络(LSTN)。具体而言,我们首先利用卷积神经网络(Convolutional Neural Networks)估计每帧的密度图。然后为关联相邻帧间的密度图,引入一个局部约束空间变换(LST)模块,利用当前帧的密度图估计下一帧的密度图。为便于性能评估,我们收集了一个大规模视频人群计数数据集,包含来自13个不同场景的15K帧及约394K个标注头部。据我们所知,这是最大的视频人群计数数据集。在我们数据集及其他人群计数数据集上的大量实验验证了LSTN用于人群计数的有效性。

关键词

引用

@article{arxiv.1907.07911,
  title  = {Locality-constrained Spatial Transformer Network for Video Crowd Counting},
  author = {Yanyan Fang and Biyun Zhan and Wandi Cai and Shenghua Gao and Bo Hu},
  journal= {arXiv preprint arXiv:1907.07911},
  year   = {2019}
}

备注

Accepted by ICME2019(Oral)