用于高效目标跟踪的可分离自注意力与混合注意力 Transformer
计算机视觉与模式识别
2023-09-11 v1
摘要
将 Transformer 用于视觉目标跟踪已在多个基准上展现出最先进的性能。然而,由于其注意力块的计算复杂性,基于 Transformer 的模型在孪生轻量级跟踪中未得到充分利用。本文提出了一种用于轻量级跟踪的高效自注意力与混合注意力 Transformer 架构。所提出的骨干网络利用可分离混合注意力 Transformer 在特征提取过程中融合模板与搜索区域,以生成更优的特征编码。我们的预测头通过高效自注意力块对编码特征进行全局上下文建模,以实现鲁棒的目标状态估计。基于这些贡献,所提出的轻量级跟踪器首次同时部署了基于 Transformer 的骨干与头部模块。我们的消融研究证实了所提出的骨干与头部模块组合的有效性。仿真表明,我们的基于可分离自注意力与混合注意力的跟踪器 SMAT 在 GOT10k、TrackingNet、LaSOT、NfS30、UAV123 和 AVisT 数据集上超越了相关轻量级跟踪器的性能,同时在 CPU 上以 37 fps、GPU 上以 158 fps 运行,并具有 3.8M 参数。例如,在 AO 指标上,它在 GOT10k-test 上分别大幅超越密切相关的跟踪器 E.T.Track 和 MixFormerV2-S,优势达 7.9% 和 5.8%。跟踪器代码与模型可在 https://github.com/goutamyg/SMAT 获取。
引用
@article{arxiv.2309.03979,
title = {Separable Self and Mixed Attention Transformers for Efficient Object Tracking},
author = {Goutam Yelluru Gopal and Maria A. Amer},
journal= {arXiv preprint arXiv:2309.03979},
year = {2023}
}
备注
Accepted by WACV2024. Code available at https://github.com/goutamyg/SMAT