面向视频人群计数的运动引导非局部时空网络
计算机视觉与模式识别
2021-04-30 v1
摘要
我们研究视频人群计数,即估计视频序列所有帧中目标(本文为人)的数量。以往人群计数工作多集中于静态图像。关于如何在短程与长程上恰当提取并利用相邻帧间的时空相关性,以在视频序列上实现高估计精度,已有研究甚少。本文提出 Monet,一种新颖且高精度的运动引导非局部时空网络用于视频人群计数。Monet 首先以人流(运动信息)为引导,粗略分割出可能存在人的像素区域。给定这些区域后,Monet 使用非局部时空网络提取短程与长程的时空上下文信息。整个网络最终以融合损失端到端训练,生成高质量密度图。注意到公开视频人群数据集稀缺且质量低(在分辨率和场景多样性方面),我们收集并构建了一个大规模视频人群计数数据集 VidCrowd,以贡献于社区。VidCrowd 包含 9,000 帧高分辨率(2560 x 1440)图像,具有在两个城市不同场景、人群密度和光照下标注的 1,150,239 个人头标注。我们在具有挑战性的 VidCrowd 以及两个公开视频人群计数数据集 UCSD 和 Mall 上进行了大量实验。与其他最先进方法相比,我们的方法在 MAE 和 MSE 上取得了显著更优的性能。
引用
@article{arxiv.2104.13946,
title = {Motion-guided Non-local Spatial-Temporal Network for Video Crowd Counting},
author = {Haoyue Bai and S. -H. Gary Chan},
journal= {arXiv preprint arXiv:2104.13946},
year = {2021}
}