受社交分组和时空位移先验信息启发的拥挤视频行人计数
计算机视觉与模式识别
2026-01-06 v1
摘要
视频行人计数(VIC)是一种新近提出的任务,旨在从视频中估算行人流量。它超越了视频人群计数(VCC),不再仅针对单帧的人数统计。与VCC不同,VIC需要在不同帧之间识别共存的行人,这实际上是一个配对问题。然而,现有的VIC方法在地铁等拥挤场景下往往表现不佳。为此,我们构建了WuhanMetroCrowd数据集,这是最早的、刻画拥挤动态行人流的VIC数据集。该数据集具有稀疏到密集的密度水平、短到长的视频片段、慢到快的流变、前到后的外观变化以及轻到重的遮挡。为更好地适应VIC方法处理人群情况,我们重新思考了VIC的本质,认识到两种信息先验:即社交分组先验,指出行人倾向于聚集成群;以及时空位移先验,指出单个行人不能物理传送。前者启发我们放宽VIC常用的单对单(O2O)匹配为单对多(O2M)匹配,通过隐式上下文生成器和O2M匹配器实现;后者促进了位移先验注入器的设计,这不仅强化了O2M匹配,也增强了特征提取和模型训练。这些设计共同构成了一个新颖且强大的VIC基线方法OMAN++。大量实验表明,OMAN++不仅在标准SenseCrowd、CroHD和MovingDroneCrowd基准上超越了最新的VIC基线方法,还在拥挤场景中表现出明显优势,在我们构建的WuhanMetroCrowd数据集上实现了38.12%的误差降低。代码、数据和预训练模型均可在https://github.com/tiny-smart/OMAN访问。
引用
@article{arxiv.2601.01192,
title = {Crowded Video Individual Counting Informed by Social Grouping and Spatial-Temporal Displacement Priors},
author = {Hao Lu and Xuhui Zhu and Wenjing Zhang and Yanan Li and Xiang Bai},
journal= {arXiv preprint arXiv:2601.01192},
year = {2026}
}
备注
Journal Extension of arXiv:2506.13067