中文

用于视觉目标跟踪的可变形孪生注意力网络

计算机视觉与模式识别 2021-03-25 v2

摘要

基于 Siamese 的跟踪器在视觉目标跟踪上已取得优异性能。然而,目标模板未在线更新,且目标模板与搜索图像的特征在 Siamese 架构中独立计算。本文中,我们提出可变形 Siamese 注意力网络,称为 SiamAttn,引入一种新的 Siamese 注意力机制来计算可变形自注意力与交叉注意力。自注意力通过空间注意力学习强上下文信息,并利用通道注意力选择性地强调相互依赖的通道特征。交叉注意力能够聚合目标模板与搜索图像间丰富的上下文相互依赖关系,提供一种自适应更新目标模板的隐式方式。此外,我们设计了一个区域细化模块,在注意力特征间计算深度可分离互相关以实现更精准跟踪。我们在六个基准上开展实验,我们的方法取得了新的 SOTA 结果,在 VOT 2016 和 2018 上以 0.464->0.537 和 0.415->0.470 的 EAO 优于强基线 SiamRPN++ [24]。我们的代码见:https://github.com/msight-tech/research-siamattn。

关键词

引用

@article{arxiv.2004.06711,
  title  = {Deformable Siamese Attention Networks for Visual Object Tracking},
  author = {Yuechen Yu and Yilei Xiong and Weilin Huang and Matthew R. Scott},
  journal= {arXiv preprint arXiv:2004.06711},
  year   = {2021}
}

备注

CVPR 2020, with code available at: https://github.com/msight-tech/research-siamattn