中文

TAPTRv3:空间与时域上下文培育长视频中任意点的稳健跟踪

计算机视觉与模式识别 2025-09-29 v2

摘要

本文基于TAPTRv2,提出TAPTRv3。TAPTRv2是一个简单而有效的DETR-like点跟踪框架,能在常规视频中正常工作,但在长视频中容易失败。TAPTRv3通过解决TAPTRv2在从长视频中查询高质量特征方面的不足,进行了改进,其中目标跟踪点通常随时间逐渐发生变化。在TAPTRv3中,我们提出利用空间和时域上下文,以获得更好的特征查询沿着空间和时域维度,以实现长视频中更稳健的跟踪。为了更好的空间特征查询,我们指出,注意力机制在点级任务中表现不佳,提出了情境感知跨注意力(CCA)。CCA引入空间上下文以增强查询图像特征时的注意力得分。为了更好的时域特征查询,我们引入可见性感知长时序注意力(VLTA),该方法在考虑相应可见性的情况下,对过去帧进行时序注意力。这有效解决了TAPTRv2因其类RNN长期建模而导致的特征漂移问题。TAPTRv3在大多数具有挑战性的数据集上均显著优于TAPTRv2,并获得了最先进的性能。即使与在大规模额外内部数据上训练的方法相比,TAPTRv3仍显示出优势。

关键词

引用

@article{arxiv.2411.18671,
  title  = {TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video},
  author = {Jinyuan Qu and Hongyang Li and Shilong Liu and Tianhe Ren and Zhaoyang Zeng and Lei Zhang},
  journal= {arXiv preprint arXiv:2411.18671},
  year   = {2025}
}