MambaLCT:基于长期上下文状态空间模型增强目标跟踪
计算机视觉与模式识别
2024-12-19 v1
摘要
从视频序列中有效构建具有长期依赖关系的上下文信息对于目标跟踪至关重要。然而,现有工作构建的上下文长度有限,仅考虑相邻帧或视频片段中的目标信息,导致上下文信息利用不充分。为解决此问题,我们提出 MambaLCT,它构建并利用从首帧到当前帧的目标变化线索以实现鲁棒跟踪。首先,设计了一个新颖的单向 Context Mamba 模块,沿时间维度扫描帧特征,收集整个序列中的目标变化线索。具体而言,通过选择性扫描机制将帧特征中与目标相关的信息压缩至隐状态空间。整个视频中的目标信息被持续聚合为目标变化线索。接着,我们将目标变化线索注入注意力机制,为建模模板帧与搜索帧之间的关系提供时序信息。MambaLCT 的优势在于能够持续扩展上下文长度,捕获完整的目标变化线索,从而增强跟踪器的稳定性和鲁棒性。大量实验表明,长期上下文信息增强了模型在复杂场景中感知目标的能力。MambaLCT 在六个基准测试上取得了新的 SOTA 性能,同时保持了实时运行速度。
引用
@article{arxiv.2412.13615,
title = {MambaLCT: Boosting Tracking via Long-term Context State Space Model},
author = {Xiaohai Li and Bineng Zhong and Qihua Liang and Guorong Li and Zhiyi Mo and Shuxiang Song},
journal= {arXiv preprint arXiv:2412.13615},
year = {2024}
}