中文

利用轻量级分层ViT与动态框架实现高效视觉跟踪

计算机视觉与模式识别 2025-06-26 v1 机器学习

摘要

基于Transformer的视觉跟踪器因其强大的建模能力而取得了显著进展。然而,由于处理速度慢,它们在资源受限设备上的实用性受到限制。为了应对这一挑战,我们提出了HiT,一个新颖的高效跟踪模型系列,它在各种设备上实现高性能的同时保持快速运行。HiT的核心创新在于其桥接模块,该模块将轻量级Transformer连接到跟踪框架,增强了特征表示质量。此外,我们引入了一种双图像位置编码方法来有效编码空间信息。HiT在NVIDIA Jetson AGX平台上实现了61帧/秒(fps)的惊人速度,同时在LaSOT基准测试上取得了具有竞争力的64.6% AUC,超越了所有先前的高效跟踪器。在HiT的基础上,我们提出了DyHiT,一种高效动态跟踪器,它通过选择具有不同计算需求的路径来灵活适应场景复杂度。DyHiT使用骨干网络提取的搜索区域特征,并将其输入高效动态路由器以分类跟踪场景。基于分类结果,DyHiT应用分治策略,选择合适的路径以实现精度和速度之间的优越权衡。DyHiT的最快版本在NVIDIA Jetson AGX上达到111 fps,同时在LaSOT上保持了62.4%的AUC。此外,我们引入了一种基于DyHiT动态路由架构的免训练加速方法。该方法在不牺牲精度的情况下显著提高了各种高性能跟踪器的执行速度。例如,我们的加速方法使最先进的跟踪器SeqTrack-B256在NVIDIA GeForce RTX 2080 Ti GPU上实现了2.68倍的加速,同时在LaSOT上保持了相同的69.9% AUC。

关键词

引用

@article{arxiv.2506.20381,
  title  = {Exploiting Lightweight Hierarchical ViT and Dynamic Framework for Efficient Visual Tracking},
  author = {Ben Kang and Xin Chen and Jie Zhao and Chunjuan Bo and Dong Wang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2506.20381},
  year   = {2025}
}

备注

This paper was accepted by International Journal of Computer Vision(IJCV)