中文

用于无人机跟踪的相似度引导层自适应 Vision Transformer

计算机视觉与模式识别 2025-03-11 v1

摘要

Vision Transformer(ViT)已成为视觉跟踪的流行骨干网络。然而,完整的 ViT 架构过于庞大,无法部署于极度强调效率的无人机(UAV)跟踪中。在本研究中,我们发现轻量级基于 ViT 的跟踪器中的许多层倾向于学习相对冗余和重复的目标表示。基于这一观察,我们提出了一种相似度引导的层自适应方法来优化 ViT 的结构。我们的方法动态禁用大量表示相似的层,并仅在其中选择性地保留单个最优层,旨在实现更好的精度-速度权衡。通过将这种方法整合到现有的 ViT 中,我们将先前完整的 ViT 架构裁剪为一个高效的相似度引导层自适应框架,即 SGLATrack,用于实时 UAV 跟踪。在六个跟踪基准上的大量实验验证了所提方法的有效性,并表明我们的 SGLATrack 在保持竞争性跟踪精度的同时实现了 SOTA 的实时速度。代码和模型可在 https://github.com/GXNU-ZhongLab/SGLATrack 获取。

关键词

引用

@article{arxiv.2503.06625,
  title  = {Similarity-Guided Layer-Adaptive Vision Transformer for UAV Tracking},
  author = {Chaocan Xue and Bineng Zhong and Qihua Liang and Yaozong Zheng and Ning Li and Yuanliang Xue and Shuxiang Song},
  journal= {arXiv preprint arXiv:2503.06625},
  year   = {2025}
}