中文

TrTr:基于 Transformer 的视觉跟踪

计算机视觉与模式识别 2021-05-11 v1

摘要

基于模板的判别式跟踪器因其鲁棒性和准确性目前是主流的跟踪方法,而依赖于从模板与搜索图像中提取特征之间互相关运算的孪生网络方法展现出最先进的跟踪性能。然而,一般的互相关运算只能获得两张特征图局部块之间的关系。本文中,我们提出一种基于强大注意力机制即 Transformer 编码器-解码器架构的新型跟踪器网络,以获取全局且丰富的上下文相互依赖关系。在这一新架构中,模板图像的特征在编码器部分经自注意力模块处理以学习强上下文信息,随后被送入解码器部分与经另一自注意力模块处理的搜索图像特征计算交叉注意力。此外,我们利用 Transformer 的输出设计分类与回归头,基于形状无关锚框定位目标。我们在 VOT2018、VOT2019、OTB-100、UAV、NfS、TrackingNet 和 LaSOT 基准上广泛评估了我们的跟踪器 TrTr,且我们的方法相对于最先进算法表现更优。训练代码与预训练模型可在 https://github.com/tongtybj/TrTr 获取。

关键词

引用

@article{arxiv.2105.03817,
  title  = {TrTr: Visual Tracking with Transformer},
  author = {Moju Zhao and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2105.03817},
  year   = {2021}
}

备注

11 pages, 5 figures