中文

通过双分支全Transformer网络学习跟踪表征

计算机视觉与模式识别 2021-12-07 v1

摘要

我们提出了一种仅基于Transformer的类似Siamese双分支网络用于跟踪。给定模板与搜索图像,我们将其划分为不重叠的图像块,并基于每个图像块在注意力窗口内与其他块的匹配结果提取特征向量。对于每个token,我们估计其是否包含目标对象及相应尺寸。该方法的优势在于特征从匹配中学习,并最终用于匹配,因此特征与对象跟踪任务对齐。该方法取得了优于或可与最佳性能方法(先使用CNN提取特征再使用Transformer融合)相比的结果,在GOT-10k与VOT2020基准上超越了SOTA方法。此外,该方法在单块GPU上实现了实时推理速度(约4040 fps)。代码与模型将公开。

关键词

引用

@article{arxiv.2112.02571,
  title  = {Learning Tracking Representations via Dual-Branch Fully Transformer Networks},
  author = {Fei Xie and Chunyu Wang and Guangting Wang and Wankou Yang and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2112.02571},
  year   = {2021}
}

备注

ICCV21 Workshops