中文

AViTMP:一种用于单分支视觉跟踪的跟踪专用Transformer

计算机视觉与模式识别 2024-07-08 v3

摘要

视觉目标跟踪是交通系统尤其是智能驾驶的基本组成部分。尽管近期的单分支跟踪器在视觉跟踪中取得了最先进的性能,但它们往往忽视了与视觉Transformer(ViT)编码器及视觉跟踪推理流水线相关的弱先验假设。此外,由于采用双分支流水线,判别性跟踪器的有效性仍受限制。为应对原始ViT的欠佳有效性,我们提出一种自适应ViT模型预测跟踪器(AViTMP)来设计定制化的跟踪方法。该方法首次将单分支网络与判别模型桥接。具体而言,在提出的编码器AViT编码器中,我们为原始ViT引入了跟踪定制化的Adaptor模块以及联合目标状态嵌入,以丰富目标先验嵌入范式。然后,我们将AViT编码器与判别性的Transformer专用模型预测器结合以预测准确位置。此外,为缓解常规推理实践的局限,我们提出了一种称为CycleTrack的新推理流水线,其通过双向循环跟踪验证在存在干扰物时增强跟踪鲁棒性。在实验中,我们在八个跟踪基准(包括LaSOT、LaSOTExtSub、AVisT等)上对AViTMP进行了综合评估。实验结果明确表明,在公平比较下,AViTMP取得了最先进的性能,尤其在长期跟踪与鲁棒性方面。源代码将于https://github.com/Tchuanm/AViTMP发布。

关键词

引用

@article{arxiv.2310.19542,
  title  = {AViTMP: A Tracking-Specific Transformer for Single-Branch Visual Tracking},
  author = {Chuanming Tang and Kai Wang and Joost van de Weijer and Jianlin Zhang and Yongmei Huang},
  journal= {arXiv preprint arXiv:2310.19542},
  year   = {2024}
}

备注

IEEE Transactions on Intelligent Vehicles