中文

MambaVLT:用于视觉语言跟踪的时间演化多模态状态空间模型

计算机视觉与模式识别 2024-11-26 v1

摘要

视觉语言跟踪任务旨在基于各种模态参考执行对象跟踪。现有的基于 Transformer 的视觉语言跟踪方法通过利用自注意力的全局建模能力取得了显著进展。然而,当前方法仍面临在有效利用时序信息和在跟踪期间动态更新参考特征方面存在挑战。最近,因其在高效长序列建模方面的惊人能力而广受瞩目的状态空间模型(SSM),即 Mamba,其状态空间演化过程显示出在线性复杂度下记忆多模态时序信息方面的潜在能力。基于其成功,我们提出了一个基于 Mamba 的视觉语言跟踪模型,探索其在时序空间中利用状态空间演化能力,以实现稳健的多模态跟踪,称为 MambaVLT。具体而言,我们的方法主要集成了时间演化混合状态空间模块和选择性局部增强模块,以捕获多模态建模的上下文信息和自适应参考特征更新。此外,我们引入了一个模态选择模块,动态调整视觉参考和语言参考之间的权重,以减轻任一参考类型的潜在歧义。大量实验结果表明,我们的方法在多样化基准上均表现优于最先进的跟踪器。

关键词

引用

@article{arxiv.2411.15459,
  title  = {MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking},
  author = {Xinqi Liu and Li Zhou and Zikun Zhou and Jianqiu Chen and Zhenyu He},
  journal= {arXiv preprint arXiv:2411.15459},
  year   = {2024}
}