中文

基于双流残差卷积网络的鲁棒视觉目标跟踪

计算机视觉与模式识别 2020-05-15 v1

摘要

当前基于深度学习的视觉跟踪方法通过离线模式下从大量有监督训练数据中学习目标分类和/或估计模型已非常成功。然而,由于密集干扰物体、杂乱背景、运动模糊等更具挑战性的问题,它们中的大多数在跟踪物体时仍可能失败。受人类“视觉跟踪”能力的启发——该能力利用运动线索将目标与背景区分开来,我们提出了一种用于视觉跟踪的双流残差卷积网络(TS-RCN),它成功利用了外观与运动特征进行模型更新。我们的 TS-RCN 可与现有的基于深度学习的视觉跟踪器集成。为了进一步提升跟踪性能,我们采用“更宽”的残差网络 ResNeXt 作为其特征提取骨干。据我们所知,TS-RCN 是首个端到端可训练的双流视觉跟踪系统,它充分利用了目标的外观与运动特征。我们在最常用的基准数据集(包括 VOT2018、VOT2019 和 GOT-10K)上对 TS-RCN 进行了广泛评估。实验结果成功表明,我们的双流模型大幅优于基于外观的跟踪器,并达到了最先进的性能。该跟踪系统最高可运行于 38.1 FPS。

关键词

引用

@article{arxiv.2005.06536,
  title  = {Robust Visual Object Tracking with Two-Stream Residual Convolutional Networks},
  author = {Ning Zhang and Jingen Liu and Ke Wang and Dan Zeng and Tao Mei},
  journal= {arXiv preprint arXiv:2005.06536},
  year   = {2020}
}