中文

稀疏 BEV 融合与自视图一致性用于多视角检测与跟踪

计算机视觉与模式识别 2025-09-11 v1 人工智能

摘要

多视角多目标跟踪 (MVMOT) 是监控、自动驾驶和体育分析等应用领域的关键技术。然而,由于视角变化、光照变化和遮挡,维持跨多个摄像机的物体身份一致性仍然具有挑战性,常导致跟踪错误。最近的研究方法将来自多个摄像机的特征投影到统一的鸟瞰视角 (BEV) 空间,以提高对遮挡的鲁棒性。然而,这种投影会引入特征畸变和非均匀密度,由于目标随距离大小的变化导致。这些问题会降低融合表示的质量,并减少检测和跟踪精度。为解决这些问题,本文提出了 SCFusion 框架,通过结合三项技术来改进多视角特征集成。首先,应用稀疏变换以避免投影中的不自然插值。接着,进行密度感知加权,根据空间置信度和摄像机距离自适应融合特征。最后,引入多视角一致性损失,鼓励每个摄像机在融合前独立学习判别性特征。实验表明,SCFusion 在 WildTrack 上实现了 95.9% 的 IDF1 分数,在 MultiviewX 上实现了 89.2% 的 MODP 分数,超越基线方法 TrackTacular。这些结果表明,SCFusion 有效缓解了传统 BEV 投影的局限性,为多视角目标检测与跟踪提供了稳健且精确的解决方案。

关键词

引用

@article{arxiv.2509.08421,
  title  = {Sparse BEV Fusion with Self-View Consistency for Multi-View Detection and Tracking},
  author = {Keisuke Toida and Taigo Sakai and Naoki Kato and Kazutoyo Yokota and Takeshi Nakamura and Kazuhiro Hotta},
  journal= {arXiv preprint arXiv:2509.08421},
  year   = {2025}
}