中文

基于对抗数据增强与目标自适应 LSTM 网络的实时视觉跟踪

计算机视觉与模式识别 2020-02-10 v1

摘要

近年来,基于深度学习的视觉跟踪方法凭借卷积神经网络(CNNs)强大的特征表示能力取得了巨大成功。其中,基于分类的跟踪方法表现出优异性能,但其速度严重受限于海量候选框特征提取的高昂计算。相比之下,基于匹配的跟踪方法(如孪生网络)具有显著的速度优势。然而,缺乏在线更新使这些方法难以适应显著的目标外观变化。本文提出一种新颖的实时视觉跟踪方法,采用目标自适应 LSTM 网络有效捕获视频序列依赖并自适应学习目标外观变化。为获得高计算效率,我们还提出一种快速候选框选择策略,利用基于匹配的跟踪方法预估计密集候选框并筛选高质量候选框输入 LSTM 网络进行分类。该策略高效过滤无关候选框并避免特征提取的冗余计算,使我们的方法比传统基于分类的跟踪方法更快。此外,为处理在线跟踪中样本不足与类别不平衡问题,我们采用基于生成对抗网络(GAN)的数据增强技术以辅助 LSTM 网络训练。在四个视觉跟踪基准上的大量实验证明了我们的方法在跟踪精度与速度上均达到最先进性能,展现了循环结构用于视觉跟踪的巨大潜力。

关键词

引用

@article{arxiv.2002.02598,
  title  = {Object-Adaptive LSTM Network for Real-time Visual Tracking with Adversarial Data Augmentation},
  author = {Yihan Du and Yan Yan and Si Chen and Yang Hua},
  journal= {arXiv preprint arXiv:2002.02598},
  year   = {2020}
}