GMT:面向多摄像头多目标跟踪的全局框架
计算机视觉与模式识别
2025-11-26 v2
摘要
多摄像头多目标跟踪(MCMT)旨在定位并关联多个摄像头视图中的同一目标。现有方法通常采用两阶段框架,即单摄像头跟踪 followed by 跨摄像头跟踪。然而,在该范式下,多视图信息仅用于在第一阶段恢复遗漏匹配,对整体跟踪贡献有限。为此,我们提出GMT,一个全局MCMT跟踪框架,联合利用视内和视间线索进行跟踪。具体而言,我们将不同视图中的相同历史目标整合为全局轨迹,从而将两阶段跟踪重新建模为统一的全局级轨迹-目标关联过程。我们引入一个跨视图特征一致性增强(CFCE)模块,以跨视图对齐视觉和空间特征,为全局轨迹建模提供一致的特征空间。有了这些对齐后的特征,全局轨迹关联(GTA)模块即可将新的检测结果与现有的全局轨迹关联,从而直接利用多视图信息。与两阶段框架相比,GMT在现有数据集上实现了显著的改进,CVMA提升最高可达21.3%,CVIDF1提升最高可达17.2%。此外,我们引入VisionTrack,一个高质量的大规模MCMT数据集,提供的多样性显著超过现有数据集。我们的代码和数据集将公开 release。
引用
@article{arxiv.2407.01007,
title = {GMT: Effective Global Framework for Multi-Camera Multi-Target Tracking},
author = {Yihao Zhen and Mingyue Xu and Qiang Wang and Baojie Fan and Jiahua Dong and Tinghui Zhao and Huijie Fan},
journal= {arXiv preprint arXiv:2407.01007},
year = {2025}
}