SMTrack:用于视觉跟踪中高效时序建模的面向状态的 Mamba
计算机视觉与模式识别
2026-02-03 v1
摘要
视觉跟踪旨在自动估计视频序列中目标对象的状态,这在动态场景中尤其具有挑战性。因此,提出了诸多方法来引入时序线索以增强跟踪鲁棒性。然而,传统的 CNN 和 Transformer 架构在建模视觉跟踪中的长程时序依赖性方面存在固有局限,往往需要定制的复杂模块或 substantial 计算成本来整合时序线索。灵感来自状态空间模型的成功,我们提出了一种用于视觉跟踪的新型时序建模范例,称为 State-aware Mamba Tracker(SMTrack),为训练和跟踪提供了一条无需定制模块或 substantial 计算成本即可构建长程时序依赖性的简洁管道。它具有若干优势:首先,我们提出了一种新型选择性状态感知空间模型,采用状态参数来捕捉更为多样化的时序线索以实现稳健跟踪。其次,SMTrack 在训练期间以线性计算复杂度实现长程时序相互作用。此外,SMTrack 使每个帧能够通过隐藏状态的传播和更新与先前跟踪的帧进行交互,从而在跟踪期间释放处理时序线索的计算成本。大量实验结果表明,SMTrack 在 low 计算成本下实现了有希望的性能。
引用
@article{arxiv.2602.01677,
title = {SMTrack: State-Aware Mamba for Efficient Temporal Modeling in Visual Tracking},
author = {Yinchao Ma and Dengqing Yang and Zhangyu He and Wenfei Yang and Tianzhu Zhang},
journal= {arXiv preprint arXiv:2602.01677},
year = {2026}
}
备注
This paper is accepted by IEEE TIP