中文

探索用于视频级目标跟踪的增强上下文信息

计算机视觉与模式识别 2024-12-17 v1

摘要

视频级的上下文信息对于视觉目标跟踪变得越来越重要。然而,现有方法通常仅使用少量 token 来传递这些信息,这可能导致信息丢失并限制其充分捕获上下文的能力。为了解决这个问题,我们提出了一种名为 MCITrack 的视频级视觉目标跟踪新框架。它利用 Mamba 的隐藏状态在整个视频流中持续记录和传递大量上下文信息,从而实现更鲁棒的目标跟踪。MCITrack 的核心组件是上下文信息融合模块,由 mamba 层和交叉注意力层组成。mamba 层存储历史上下文信息,而交叉注意力层将这些信息整合到每个骨干网络块的当前视觉特征中。该模块通过与骨干网络的深度融合,增强了模型在多个层级上捕获和利用上下文信息的能力。实验表明,MCITrack 在众多基准测试中取得了极具竞争力的性能。例如,它在 LaSOT 上获得了 76.6% 的 AUC,在 GOT-10k 上获得了 80.0% 的 AO,创造了新的 SOTA 性能。代码和模型可在 https://github.com/kangben258/MCITrack 获取。

关键词

引用

@article{arxiv.2412.11023,
  title  = {Exploring Enhanced Contextual Information for Video-Level Object Tracking},
  author = {Ben Kang and Xin Chen and Simiao Lai and Yang Liu and Yi Liu and Dong Wang},
  journal= {arXiv preprint arXiv:2412.11023},
  year   = {2024}
}

备注

This paper was accepted by AAAI2025