中文

基于卷积网络的鲁棒视觉跟踪

计算机视觉与模式识别 2015-08-25 v2

摘要

深度网络已通过从大量训练图像中离线学习通用表示,成功应用于视觉跟踪。然而,离线训练耗时较长,且学习到的通用表示针对特定对象的跟踪判别力可能不足。本文表明,即使无需利用大量辅助数据进行离线训练,简单的双层卷积网络也足以开发出用于视觉跟踪的鲁棒表示。在第一帧中,我们采用 k-means 算法从目标区域提取一组归一化图像块作为固定滤波器,并结合围绕目标的一系列自适应上下文滤波器,以在后续帧中定义一组特征图。这些特征图测量每个滤波器与目标上有用的局部强度模式之间的相似度,从而编码其局部结构信息。此外,所有特征图共同构成一个基于中层特征的全局表示,该表示贴近图像级信息,因而能很好地保留目标的内部几何布局。我们采用一种带有自适应阈值的简单软收缩方法对全局表示进行去噪,从而得到鲁棒的稀疏表示。该表示通过一种简单有效的在线策略进行更新,使其能够鲁棒地适应目标外观的变化。我们的卷积网络结构 surprisingly lightweight,但在包含 50 个挑战性视频的 CVPR2013 跟踪基准数据集上,表现优于多种最先进方法。

关键词

引用

@article{arxiv.1501.04505,
  title  = {Robust Visual Tracking via Convolutional Networks},
  author = {Kaihua Zhang and Qingshan Liu and Yi Wu and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:1501.04505},
  year   = {2015}
}