中文

COVTrack++:通过协同范式学习连续视频中的开放词汇多目标跟踪

计算机视觉与模式识别 2026-03-26 v1 机器学习

摘要

多目标跟踪 (MOT) 传统上聚焦于有限几个特定类别,将其适用性限制于涉及多样化对象的真实场景。开放词汇多目标跟踪 (OVMOT) 通过使能够跟踪任意类别,包括训练期未见的 Novel objects 来解决这个问题。然而,当前进展受限于两个挑战:缺乏用于训练的连续标注视频数据,以及缺乏针对 OVMOT 的定制框架以协同处理 detection 和 association。我们通过构建 C-TAO,第一个为 OVMOT 设计的连续标注训练集来解决数据瓶颈,该训练集将原始 TAO 的标注密度提高了 26 倍,并捕捉到平滑的运动动力学和中间 object 状态。对于框架瓶颈,我们提出 COVTrack++,一个协同框架通过三个模块实现双向互惠机制:(1) 多线索自适应融合 (MCF) 动态平衡 appearance、motion 和 semantic 线索用于 association feature learning;(2) 多层次层次聚合 (MGA) 利用密集 detection 中的层次空间关系,其中可见 child nodes (如 object 部件) 辅助遮挡 parent objects (如整体身体) 以增强 association feature;(3) 时间置信度传播 (TCP) 通过高置信度已跟踪 objects 提升低置信度候选者跨帧,稳定轨迹。广泛的在 TAO 上的实验表明,COVTrack++ 实现了业界最佳性能, Novel TETA 在 validation 和 test 集上分别达到 35.4% 和 30.5%,在 Novel AssocA 和 Novel LocA 上分别比先前方法提高了 4.8% 和 5.8%,并在 BDD100K 上表现出强大的 zero-shot generalization。该代码和数据集将公开可用。

关键词

引用

@article{arxiv.2603.24016,
  title  = {COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm},
  author = {Zekun Qian and Wei Feng and Ruize Han and Junhui Hou},
  journal= {arXiv preprint arXiv:2603.24016},
  year   = {2026}
}