中文

基于多焦点高斯邻域注意力与大规模基准的视频人群定位

计算机视觉与模式识别 2022-10-05 v4

摘要

视频人群定位是一项关键且具有挑战性的任务,旨在估计给定拥挤视频中人体头部的精确位置。为建模人体移动的空间-时间依赖关系,我们提出了一种多焦点高斯邻域注意力(GNA),其能够在保持输入视频空间拓扑结构的同时有效利用长程对应关系。特别地,我们的 GNA 还能借助所配备的多焦点机制很好地捕捉人体头部的尺度变化。基于多焦点 GNA,我们开发了名为 GNANet 的统一神经网络,通过场景建模模块与上下文交叉注意力模块充分聚合空间-时间信息,以准确位于视频片段中的头部中心。此外,为促进该领域的未来研究,我们引入了名为 VSCrowd 的大规模人群视频基准,其包含在各种监控场景下采集的 60K+ 帧与 2M+ 头部标注。最后,我们在包括我们的 SenseCrowd 在内的三个数据集上进行了大量实验,实验结果表明所提方法在视频人群定位与计数上均能取得最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.2107.08645,
  title  = {Video Crowd Localization with Multi-focus Gaussian Neighborhood Attention and a Large-Scale Benchmark},
  author = {Haopeng Li and Lingbo Liu and Kunlin Yang and Shinan Liu and Junyu Gao and Bin Zhao and Rui Zhang and Jun Hou},
  journal= {arXiv preprint arXiv:2107.08645},
  year   = {2022}
}