面向视觉跟踪的深度学习:一项综合性综述
计算机视觉与模式识别
2021-01-27 v2 机器学习
图像与视频处理
摘要
视觉目标跟踪是计算机视觉中备受关注却又极具挑战的研究课题之一。鉴于该问题的不适定性及其在广泛真实场景中的流行,已建立多个大规模基准数据集,近年来众多方法得以发展并展现出显著进展——主要由近期基于深度学习(DL)的方法取得。本综述旨在系统性地调研当前基于 DL 的视觉跟踪方法、基准数据集与评估指标,并对领先的视觉跟踪方法进行了广泛评估与分析。首先,从网络架构、网络利用、面向视觉跟踪的网络训练、网络目标、网络输出、相关滤波优势的利用、俯视跟踪、长时跟踪与在线跟踪九个关键方面,总结了基于 DL 方法的基本特征、主要动机与贡献。其次,比较了流行的视觉跟踪基准及其各自特性,并总结了其评估指标。第三,在 OTB2013、OTB2015、VOT2018、LaSOT、UAV123、UAVDT 与 VisDrone2019 等一系列成熟基准上对已是最先进的基于 DL 的方法进行了全面考察。最后,通过对这些最先进跟踪器进行定量与定性关键分析,考察了它们在多种常见场景下的优缺点。它可作为从业者权衡何时及在何种条件下选择何种方法的温和使用指南,亦促进了对现存问题的讨论并启示了有前景的研究方向。
引用
@article{arxiv.1912.00535,
title = {Deep Learning for Visual Tracking: A Comprehensive Survey},
author = {Seyed Mojtaba Marvasti-Zadeh and Li Cheng and Hossein Ghanei-Yakhdan and Shohreh Kasaei},
journal= {arXiv preprint arXiv:1912.00535},
year = {2021}
}
备注
Accepted Manuscript in IEEE Transactions on Intelligent Transportation Systems