MambaEVT:基于状态空间模型的事件流视觉目标跟踪
计算机视觉与模式识别
2024-08-21 v1 人工智能
摘要
基于事件相机的视觉跟踪近年来引起了越来越多的关注,这得益于其独特的成像原理以及低能耗、高动态范围和密集时间分辨率等优势。当前基于事件的跟踪算法正逐渐遇到性能瓶颈,原因在于对视觉Transformer和用于目标定位的静态模板的依赖。本文提出了一种新颖的基于Mamba的视觉跟踪框架,采用具有线性复杂度的状态空间模型作为骨干网络。搜索区域和目标模板被输入到视觉Mamba网络中进行同时的特征提取和交互。搜索区域的输出令牌将被送入跟踪头进行目标定位。更重要的是,我们考虑通过Memory Mamba网络引入动态模板更新策略。通过考虑目标模板库中样本的多样性并对模板记忆模块进行适当调整,可以集成更有效的动态模板。动态模板和静态模板的有效结合使我们的基于Mamba的跟踪算法在多个大规模数据集上实现了精度与计算成本之间的良好平衡,包括EventVOT、VisEvent和FE240hz。源代码将发布在https://github.com/Event-AHU/MambaEVT
引用
@article{arxiv.2408.10487,
title = {MambaEVT: Event Stream based Visual Object Tracking using State Space Model},
author = {Xiao Wang and Chao wang and Shiao Wang and Xixi Wang and Zhicheng Zhao and Lin Zhu and Bo Jiang},
journal= {arXiv preprint arXiv:2408.10487},
year = {2024}
}
备注
In Peer Review