探索用于高效视觉跟踪的轻量级分层视觉Transformer
计算机视觉与模式识别
2023-08-15 v1
摘要
基于 Transformer 的视觉跟踪器凭借其优越的建模能力取得了显著进展。然而,现有跟踪器受限于速度低下,难以在计算能力受限的设备上应用。为缓解该问题,我们提出 HiT,一种全新的高效跟踪模型系列,可在不同设备上以高速运行同时保持高性能。HiT 的核心思想是 Bridge Module(桥接模块),它弥合了现代轻量级 Transformer 与跟踪框架之间的差距。Bridge Module 将深层特征的高级信息融入浅层大分辨率特征中,从而为跟踪头生成更优特征。我们还提出一种新颖的双图像位置编码技术,可同时编码搜索区域与模板图像的位置信息。HiT 模型以具竞争力的性能实现了可观的速度。例如,其在 Nvidia Jetson AGX 边缘设备上以每秒 61 帧(fps)运行。此外,HiT 在 LaSOT 基准上达到 64.6% AUC,超越此前所有高效跟踪器。
引用
@article{arxiv.2308.06904,
title = {Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual Tracking},
author = {Ben Kang and Xin Chen and Dong Wang and Houwen Peng and Huchuan Lu},
journal= {arXiv preprint arXiv:2308.06904},
year = {2023}
}
备注
This paper was accepted by ICCV2023