CrowdTrack:针对真实场景中困难的多行人跟踪基准
计算机视觉与模式识别
2025-07-04 v1 人工智能
摘要
多目标跟踪是计算机视觉中的经典领域,其中行人跟踪具有极高的应用价值,已成为最受欢迎的研究方向。现有方法主要利用运动或外观信息进行跟踪,在复杂场景中常常困难。对于运动信息,对象之间的相互遮挡常常阻止更新运动状态;对于外观信息,由于仅见于部分可见性或图像模糊等原因,常常获得不稳健的结果。虽然通过在标注数据上学习在这些情况下的跟踪方法是最简单的解决方案,但现有 MOT 数据集未能满足这一需求。现有方法主要存在两个缺点:场景组成相对简单且非真实场景。尽管某些现有数据集的视频序列不具备上述缺点,但数量远远不足以满足研究需求。为此,我们提出了一个针对多行人跟踪的困难大规模数据集,主要以第一人称视角拍摄,全部来自真实生活中复杂的场景。我们将其命名为"CrowdTrack",因为大多数序列中都有大量目标。该数据集包含 33 个视频,总计 5,185 条轨迹。每个目标都标注了完整的边界框和唯一的目标 ID。该数据集将为促进在复杂情况下的有效算法开发提供平台。我们对数据集进行了全面分析,并在数据集上测试了多个 SOTA 模型。此外,我们分析了基础模型在数据集上的表现。数据集和项目代码已发布于:https://github.com/loseevaya/CrowdTrack。
引用
@article{arxiv.2507.02479,
title = {CrowdTrack: A Benchmark for Difficult Multiple Pedestrian Tracking in Real Scenarios},
author = {Teng Fu and Yuwen Chen and Zhuofan Chen and Mengyang Zhao and Bin Li and Xiangyang Xue},
journal= {arXiv preprint arXiv:2507.02479},
year = {2025}
}