中文

将更多注意力转向视觉-语言跟踪

计算机视觉与模式识别 2022-07-05 v1

摘要

依赖 Transformer 进行复杂视觉特征学习,目标跟踪已见证了最先进(SOTA)水平的新标准。然而,这一进展伴随着更大的训练数据与更长的训练周期,使跟踪日益昂贵。本文中,我们证明对 Transformer 的依赖并非必要,纯卷积网络(ConvNets)仍具竞争力,甚至在实现 SOTA 跟踪时更经济、更友好。我们的方案是释放多模态视觉-语言(VL)跟踪的威力,仅使用 ConvNets。其精髓在于通过我们的模态混合器(ModaMixer)与非对称 ConvNet 搜索学习新颖的统一自适应 VL 表征。我们表明,纯由 ConvNets 学习的统一自适应 VL 表征是 Transformer 视觉特征的简单而强大的替代,它将基于 CNN 的孪生跟踪器在具挑战性的 LaSOT 上的 SUC 惊人地提升 14.5%(50.7% > 65.2%),甚至超越若干基于 Transformer 的 SOTA 跟踪器。除经验结果外,我们从理论上分析了方法来佐证其有效性。通过揭示 VL 表征的潜力,我们期望学界将更多注意力转向 VL 跟踪,并希望为超越 Transformer 的未来跟踪开启更多可能。代码与模型将于 https://github.com/JudasDie/SOTS 发布。

关键词

引用

@article{arxiv.2207.01076,
  title  = {Divert More Attention to Vision-Language Tracking},
  author = {Mingzhe Guo and Zhipeng Zhang and Heng Fan and Liping Jing},
  journal= {arXiv preprint arXiv:2207.01076},
  year   = {2022}
}

备注

18 pages, 7 figures