中文

ODTrack:面向视觉跟踪的在线密集时序令牌学习

计算机视觉与模式识别 2024-01-04 v1

摘要

跨连续视频帧的在线上下文推理与关联对于视觉跟踪中感知实例至关重要。然而,当前大多数性能最佳的跟踪器持续依赖离线模式下参考帧与搜索帧之间的稀疏时序关系。因此,它们只能在每个图像对内独立交互,并建立有限的时序相关性。为缓解上述问题,我们提出了一种简单、灵活且有效的视频级跟踪流程,名为ODTrack,它以在线令牌传播的方式密集关联视频帧的上下文关系。ODTrack接收任意长度的视频帧以捕获实例的时空轨迹关系,并将目标的判别特征(定位信息)压缩为令牌序列以实现帧到帧的关联。这一新方案带来以下好处:1)纯化的令牌序列可作为下一视频帧推理的提示,从而利用过去信息指导未来推理;2)通过令牌序列的迭代传播有效避免了复杂的在线更新策略,因此我们可以实现更高效的模型表示和计算。ODTrack在七个基准测试上取得了新的SOTA性能,同时以实时速度运行。代码和模型可在https://github.com/GXNU-ZhongLab/ODTrack获取。

关键词

引用

@article{arxiv.2401.01686,
  title  = {ODTrack: Online Dense Temporal Token Learning for Visual Tracking},
  author = {Yaozong Zheng and Bineng Zhong and Qihua Liang and Zhiyi Mo and Shengping Zhang and Xianxian Li},
  journal= {arXiv preprint arXiv:2401.01686},
  year   = {2024}
}