SynMVCrowd:大型合成多视角人群计数与定位基准
计算机视觉与模式识别
2026-03-26 v1
摘要
现有的多视角人群计数和定位方法是在相对小规模的场景下进行评估的,这些场景的人员数量、摄像头视角和帧数有限。这使得评估和比较现有方法变得不实用,因为小数据集容易被这些方法所过拟合。为避免这些问题,3DROM 提出了一种数据增强方法。相反,本文提出了一个大型合成基准,SynMVCrowd,用于更实际的多视角人群计数和定位任务评估和比较。SynMVCrowd 基准由 50 个合成场景组成,包含大量多视角帧和摄像头视角,人群规模更大(最高可达 1000 人),更适合大规模场景下的多视角人群视觉任务。此外,我们提出了强大的多视角人群定位和计数基线模型,在新建的 SynMVCrowd 基准上超越了所有比较方法。而且,我们证明了在帮助该基准进行新实验场景的迁移学习后,能够实现更好的跨域的多视角和单图像计数性能。因此,该提出的基准将推动多视角和单图像人群计数与定位的研究向更实际的应用迈进。代码和数据集可在 https://github.com/zqyq/SynMVCrowd 访问。
引用
@article{arxiv.2603.23956,
title = {SynMVCrowd: A Large Synthetic Benchmark for Multi-view Crowd Counting and Localization},
author = {Qi Zhang and Daijie Chen and Yunfei Gong and Hui Huang},
journal= {arXiv preprint arXiv:2603.23956},
year = {2026}
}
备注
IJCV 2026