MixFormerV2:高效的 Fully Transformer 追踪
计算机视觉与模式识别
2024-02-08 v2
摘要
基于Transformer的追踪器在标准基准上已取得强劲精度。然而,其效率仍是GPU和CPU平台上实际部署的障碍。本文中,为克服该问题,我们提出了一种全Transformer追踪框架,称为\emph{MixFormerV2},不含任何稠密卷积操作和复杂分数预测模块。我们的关键设计是引入四个特殊的预测token,并将其与目标模板和搜索区域的token拼接。然后,我们对这些混合token序列应用统一的Transformer骨干。这些预测token能够通过混合注意力捕获目标模板与搜索区域间的复杂关联。基于它们,我们可以通过简单MLP头轻松预测追踪框并估计其置信度分数。为进一步提升MixFormerV2的效率,我们提出了一种基于蒸馏的新模型精简范式,包括稠密到稀疏蒸馏和深到浅蒸馏。前者旨在将基于稠密头的MixViT知识迁移到我们的全Transformer追踪器,后者用于剪枝骨干的一些层。我们实例化了两类MixFormerV2,其中MixFormerV2-B在LaSOT上达到70.6\%的AUC,在TNL2k上达到57.4\%的AUC,GPU速度高达165 FPS;MixFormerV2-S在LaSOT上以实时CPU速度超越FEAR-L达2.7\% AUC。
引用
@article{arxiv.2305.15896,
title = {MixFormerV2: Efficient Fully Transformer Tracking},
author = {Yutao Cui and Tianhui Song and Gangshan Wu and Limin Wang},
journal= {arXiv preprint arXiv:2305.15896},
year = {2024}
}
备注
NIPS2023