基于可变形Transformer的高效视觉跟踪训练
计算机视觉与模式识别
2023-09-07 v1
摘要
近期基于Transformer的视觉跟踪模型展现出优越性能。然而,由于低效的训练方法以及基于卷积的目标头,已有工作资源消耗大,需要漫长的GPU训练时长且推理时GFLOPs高。这种密集的资源使用使其不适用于现实应用。本文提出DETRack,一种精简的端到端视觉目标跟踪框架。我们的框架采用高效编码器—解码器结构,其中可变形Transformer解码器作为目标头,比传统卷积头具有更高稀疏性,从而降低GFLOPs。在训练上,我们引入新颖的一对多标签分配与辅助去噪技术,显著加速模型收敛。充分实验证实了所提方法的有效性与高效性。例如,DETRack在具挑战性的GOT-10k基准上以仅基线所需训练轮次的20%取得72.9% AO,且以低于所有基于Transformer的跟踪器的GFLOPs运行。
引用
@article{arxiv.2309.02676,
title = {Efficient Training for Visual Tracking with Deformable Transformer},
author = {Qingmao Wei and Guotian Zeng and Bi Zeng},
journal= {arXiv preprint arXiv:2309.02676},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2303.16580 by other authors