视频中人群计数的时空建模
计算机视觉与模式识别
2017-07-26 v1
摘要
感兴趣区域(ROI)人群计数可被表述为学习从图像或视频帧到人群密度图的映射的回归问题。最近,卷积神经网络(CNN)模型在人群计数上取得了有前景的结果。然而,即使处理视频数据,基于CNN的方法仍独立考虑每个视频帧,忽略了相邻帧之间强的时间相关性。为利用视频序列中原本非常有用的时间信息,我们提出了一种称为卷积LSTM(ConvLSTM)的近期深度学习模型的变体用于人群计数。与先前基于CNN的方法不同,我们的方法充分捕获了空间和时间依赖性。此外,我们将ConvLSTM模型扩展为双向ConvLSTM模型,该模型可双向访问长距离信息。使用四个公开可用数据集的广泛实验证明了我们方法的可靠性以及纳入时间信息以提升人群计数准确性的有效性。此外,我们还进行了一些迁移学习实验,表明一旦我们的模型在一个数据集上训练好,其学习经验可以轻松迁移到仅包含极少视频帧用于模型适配的新数据集。
引用
@article{arxiv.1707.07890,
title = {Spatiotemporal Modeling for Crowd Counting in Videos},
author = {Feng Xiong and Xingjian Shi and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:1707.07890},
year = {2017}
}
备注
Accepted by ICCV 2017