中文

利用多模态时空模式进行视频对象跟踪

计算机视觉与模式识别 2024-12-23 v1

摘要

多模态跟踪因其有效解决传统RGB跟踪的固有局限性而广受关注。然而,现有的多模态跟踪器主要关注空间特征的融合与增强,或仅利用视频帧之间的稀疏时序关系。这些方法未充分利用多模态视频中的时序关联,难以捕捉复杂场景下目标的动态变化和运动信息。为缓解此问题,我们提出了一种统一的多模态时空跟踪方法,称为STTrack。与以往仅依赖更新参考信息的范式不同,我们引入了时序状态生成器 (TSG),持续生成包含多模态时序信息的令牌序列。这些时序信息令牌用于指导下一时态中目标的定位,建立视频帧之间的长程语境关系,捕捉目标的时序轨迹。此外,在空间层面,我们引入了mamba融合和背景抑制交互 (BSI) 模块。这些模块建立了双阶段机制,用于协调不同模态之间的信息交互和融合。在五个基准数据集上的大量比较表明,STTrack在各种多模态跟踪场景下实现了最佳性能。代码已公开:https://github.com/NJU-PCALab/STTrack。

关键词

引用

@article{arxiv.2412.15691,
  title  = {Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking},
  author = {Xiantao Hu and Ying Tai and Xu Zhao and Chen Zhao and Zhenyu Zhang and Jun Li and Bineng Zhong and Jian Yang},
  journal= {arXiv preprint arXiv:2412.15691},
  year   = {2024}
}