深度融合多任务表征用于鲁棒视觉跟踪
计算机视觉与模式识别
2021-09-21 v2 机器学习
图像与视频处理
摘要
由于真实场景中存在各种特定问题的挑战,视觉目标跟踪仍是计算机视觉中活跃的研究领域。许多基于判别相关滤波器(DCFs)的现有跟踪方法采用特征提取网络(FENs)在学习过程中对目标外观建模。然而,此前尚未研究使用基于不同残差神经网络(ResNets)的FENs提取的深度特征图。本文旨在基于DCF的框架中评估十二种最先进的基于ResNet的FENs的性能,以确定最适合视觉跟踪者。首先,对其最佳特征图进行排序,并探索将最佳基于ResNet的FEN推广采用到另一种基于DCF的方法中。然后,所提方法从全卷积FEN中提取深度语义信息,并将其与最佳基于ResNet的特征图融合,以在连续卷积滤波器的学习过程中增强目标表征。最后,它引入了一种新颖高效的语义加权方法(在每个视频帧上使用语义分割特征图)来减轻漂移问题。在著名的OTB-2013、OTB-2015、TC-128与VOT-2018视觉跟踪数据集上的大量实验结果表明,所提方法在视觉跟踪的精度与鲁棒性方面有效优于最先进的方法。
引用
@article{arxiv.2004.01382,
title = {Effective Fusion of Deep Multitasking Representations for Robust Visual Tracking},
author = {Seyed Mojtaba Marvasti-Zadeh and Hossein Ghanei-Yakhdan and Shohreh Kasaei and Kamal Nasrollahi and Thomas B. Moeslund},
journal= {arXiv preprint arXiv:2004.01382},
year = {2021}
}
备注
To be appeared in The Visual Computer (International Journal of Computer Graphics), Springer, 2021