基于视图-地面交互的大规模真实场景多视角人群跟踪 Transformer
计算机视觉与模式识别
2026-04-22 v1
摘要
多视角人群跟踪估计每个人的跟踪轨迹位于场景的地面上。近期研究主要依赖基于 CNN 的多视角人群跟踪架构,大多数方法在相对较小的数据集上进行评估和比较,如 Wildtrack 和 MultiviewX。由于这两个数据集是在小场景中收集的,仅包含评估阶段的几十帧,因此难以将当前方法应用于场景规模和遮挡更为复杂的实际应用场景。本文提出了一种基于 Transformer 的多视角人群跟踪模型 \textit{MVTrackTrans},采用相机视图与地面平面之间的相互作用以提升多视角跟踪性能。此外,为了更好的评估,我们收集并标注了两个大型真实场景多视角跟踪数据集,MVCrowdTrack 和 CityTrack,包含更大的场景规模和更长的时间段。与在两个大型新数据集上的现有方法相比,所提出的 MVTrackTrans 模型取得了更好的性能,表明该模型设计在处理大场景方面的优势。我们相信所提出的数据集和模型将推动该任务向更实际的场景发展,数据集和代码均可在 https://github.com/zqyq/MVTrackTrans 访问获取。
引用
@article{arxiv.2604.19318,
title = {Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes},
author = {Qi Zhang and Jixuan Chen and Kaiyi Zhang and Xinquan Yu and Antoni B. Chan and Hui Huang},
journal= {arXiv preprint arXiv:2604.19318},
year = {2026}
}
备注
CVPR 2026