用于视频人群计数的局部约束空间变换网络
计算机视觉与模式识别
2019-07-19 v1
摘要
与基于单图像的人群计数相比,视频提供了人群的空间-时间信息,有助于提升人群计数的鲁棒性。但人物的平移、旋转和缩放导致相邻帧间头部密度图发生变化。同时,动态场景中人物的走入/走出或被遮挡导致头部数量发生变化。为缓解视频人群计数中的这些问题,本文提出一种局部约束空间变换网络(LSTN)。具体而言,我们首先利用卷积神经网络(Convolutional Neural Networks)估计每帧的密度图。然后为关联相邻帧间的密度图,引入一个局部约束空间变换(LST)模块,利用当前帧的密度图估计下一帧的密度图。为便于性能评估,我们收集了一个大规模视频人群计数数据集,包含来自13个不同场景的15K帧及约394K个标注头部。据我们所知,这是最大的视频人群计数数据集。在我们数据集及其他人群计数数据集上的大量实验验证了LSTN用于人群计数的有效性。
引用
@article{arxiv.1907.07911,
title = {Locality-constrained Spatial Transformer Network for Video Crowd Counting},
author = {Yanyan Fang and Biyun Zhan and Wandi Cai and Shenghua Gao and Bo Hu},
journal= {arXiv preprint arXiv:1907.07911},
year = {2019}
}
备注
Accepted by ICME2019(Oral)