中文

面向视觉目标跟踪的空间-频率 Transformer 学习

计算机视觉与模式识别 2023-03-10 v2

摘要

近期的跟踪器采用 Transformer 来组合或替换广泛使用的 ResNet 作为其新的骨干网络。尽管它们的跟踪器在常规场景下表现良好,但它们简单地将二维特征展平为序列以更好地匹配 Transformer。我们认为这些操作忽略了目标物体的空间先验,可能仅导致次优结果。此外,许多工作表明自注意力实际上是一个低通滤波器,这与输入特征或键/查询无关。也就是说,它可能抑制输入特征的高频分量并保留甚至放大低频信息。为处理这些问题,本文提出一个统一的空间-频率 Transformer,同时建模高斯空间先验与高频强调注意力(GPHA)。具体而言,高斯空间先验由双多层感知机(MLPs)生成,并注入到自注意力中由查询与键特征相乘得到的相似度矩阵中。输出将被送入 Softmax 层,然后分解为两部分,即直接信号与高频信号。低通与高通分支被重新缩放并组合以实现全通,从而高频特征在堆叠的自注意力层中得以良好保护。我们进一步将空间-频率 Transformer 集成到孪生跟踪框架中,提出一种新颖的跟踪算法,称为 SFTransT。采用基于跨尺度融合的 SwinTransformer 作为骨干,并使用多头交叉注意力模块来增强搜索与模板特征之间的交互。输出将被送入跟踪头进行目标定位。在短期与长期跟踪基准上的大量实验均证明了我们所提框架的有效性。

关键词

引用

@article{arxiv.2208.08829,
  title  = {Learning Spatial-Frequency Transformer for Visual Object Tracking},
  author = {Chuanming Tang and Xiao Wang and Yuanchao Bai and Zhe Wu and Jianlin Zhang and Yongmei Huang},
  journal= {arXiv preprint arXiv:2208.08829},
  year   = {2023}
}