MCBLT:长视频中基于多摄像机的多目标3D跟踪
计算机视觉与模式识别
2025-03-28 v3
摘要
从多视图摄像机进行目标感知对于智能系统尤其重要,尤其是在室内环境中,如仓库、零售店和医院。大多数传统的多目标多摄像机 (MTMC) 检测和跟踪方法依赖2D目标检测、单视图多目标跟踪 (MOT) 和跨视图重识别 (ReID) 技术,未能充分处理多视图图像聚合带来的重要3D信息。在本文中,我们提出一种3D目标检测和跟踪框架,命名为 MCBLT,它首先聚合具有必要摄像机标定参数的多视图图像,以获得鸟瞰视角 (BEV) 中的3D目标检测。然后,我们引入分层图神经网络 (GNN) 用于 BEV 中的3D 检测进行 MTMC 跟踪。与现有方法不同,MCBLT 在不同场景和多样化摄像机设置下具有显著的通用性,具备处理长期关联的卓越能力。因此,我们提出的 MCBLT 在 AICity'24 数据集上实现了 的 HOTA,在 WildTrack 数据集上实现了 的 IDF1, establishing a new state-of-the-art。
引用
@article{arxiv.2412.00692,
title = {MCBLT: Multi-Camera Multi-Object 3D Tracking in Long Videos},
author = {Yizhou Wang and Tim Meinhardt and Orcun Cetintas and Cheng-Yen Yang and Sameer Satish Pusegaonkar and Benjamin Missaoui and Sujit Biswas and Zheng Tang and Laura Leal-Taixé},
journal= {arXiv preprint arXiv:2412.00692},
year = {2025}
}