UCT:学习统一卷积网络用于实时视觉跟踪
计算机视觉与模式识别
2017-11-21 v1
摘要
基于卷积神经网络(CNN)的跟踪方法在近期基准测试中表现出良好性能。然而,所选 CNN 特征总是在不同任务上预训练,且跟踪系统中的各个组件被分别学习,因此所实现的跟踪性能可能并非最优。此外,由于耗时的特征提取与复杂的优化细节,这些跟踪器大多并非为实时应用而设计。本文中,我们提出一个端到端框架来同时学习卷积特征并执行跟踪过程,即统一卷积跟踪器(UCT)。具体而言,UCT 将特征提取器与跟踪过程均视为卷积操作并联合训练,使学到的 CNN 特征与跟踪过程紧密耦合。在线跟踪中,通过引入峰噪比(PNR)准则提出了一种高效更新方法,并通过在网络中融入尺度分支来高效处理尺度变化。所提方法取得了优越的跟踪性能,同时保持实时速度。标准 UCT 与 UCT-Lite 在未进一步优化的情况下可分别以 41 FPS 和 154 FPS 跟踪通用目标。实验在四个具挑战性的基准跟踪数据集 OTB2013、OTB2015、VOT2014 和 VOT2015 上进行,与其他实时跟踪器相比,我们的方法在这些基准上取得了最先进的(state-of-the-art)结果。
引用
@article{arxiv.1711.04661,
title = {UCT: Learning Unified Convolutional Networks for Real-time Visual Tracking},
author = {Zheng Zhu and Guan Huang and Wei Zou and Dalong Du and Chang Huang},
journal= {arXiv preprint arXiv:1711.04661},
year = {2017}
}
备注
ICCV2017 Workshops. arXiv admin note: text overlap with arXiv:1711.01124