来自移动无人机的视频人群个体计数与跟踪:基准数据集与方法
计算机视觉与模式识别
2026-05-29 v2
摘要
在大规模场景中进行人群密集计数与跟踪是高度实用但具有挑战性的任务。现有方法大多依赖固定摄像头数据集,场景覆盖范围有限,难以满足大规模场景下的人群分析。为弥合这一差距,我们引入MovingDroneCrowd++,这是一套最大规模的视频级数据集,专为密集人群计数与跟踪而设计,使用快速移动的无人机拍摄,覆盖多种飞行高度、摄像机角度和照明条件。现有方法仍难在这些挑战性航空条件下实现令人满意的人群计数或跟踪性能。为此,我们提出GD3A(Global Density map Decomposition via group-wise Descriptor Association),一种视频人群计数方法,首先通过带自适应dustbin得分的最优输运建立人描述符在帧之间像素级对应关系。随后采用组间关联,引导将全局密度图分解为共享密度图、流入密度图和流出密度图。我们进一步提出了行人跟踪方法DVTrack(Descriptor Voting Track),将描述符级匹配转换为实例级关联。由于我们的 methods 依赖于每个行人基于组间多个描述符的关联结果,而非单个向量,因此组间匹配误差不会影响最终的计数和跟踪结果。我们的 methods 在密集人群和挑战性航空条件下更具鲁棒性。实验表明,我们的方法在密集人群和复杂运动的移动无人机视频中显著提升了人群计数和跟踪性能,计数误差降低47.4%,跟踪准确率提升64.6%。代码、数据集和预训练模型已在 https://github.com/fyw1999/MovingDroneCrowd 提供。
引用
@article{arxiv.2601.12500,
title = {Video Individual Counting and Tracking from Moving Drones: A Benchmark and Methods},
author = {Yaowu Fan and Jia Wan and Tao Han and Andy J. Ma and Wanli Ouyang and Antoni B. Chan},
journal= {arXiv preprint arXiv:2601.12500},
year = {2026}
}