TDIOT:面向深度视频目标跟踪的目标驱动推断
计算机视觉与模式识别
2021-10-04 v2
摘要
近期基于检测跟踪的方法采用深度目标检测器作为目标检测基线,因其在静态图像上的高性能。为实现有效的视频目标跟踪,目标检测与数据关联步骤相集成,该步骤通过定制设计的推断架构或为跟踪目的端到端联合训练来完成。本工作中,我们采用前一种方法,使用预训练的 Mask R-CNN 深度目标检测器作为基线。我们提出了一种置于 Mask R-CNN 的 FPN-ResNet101 骨干网络之上的新型推断架构,以联合执行检测与跟踪,且无需为跟踪目的进行额外训练。所提出的单目标跟踪器 TDIOT 采用基于外观相似性的时序匹配进行数据关联。为解决跟踪不连续问题,我们在推断头层中引入局部搜索与匹配模块,利用 SiamFC 进行短期跟踪。此外,为提高对尺度变化的鲁棒性,我们提出一种尺度自适应区域提议网络,能够在由目标轨迹指定的自适应扩大空间邻域中搜索目标。为满足长期跟踪需求,推断架构中融入了一种低成本验证层,基于目标的 LBP 直方图模型监测其存在性。在 VOT2016、VOT2018 和 VOT-LT2018 数据集上的视频性能评估表明,TDIOT 相比最先进的短期跟踪器取得了更高精度,同时在长期跟踪中提供了可比的性能。
引用
@article{arxiv.2103.11017,
title = {TDIOT: Target-driven Inference for Deep Video Object Tracking},
author = {Filiz Gurkan and Llukman Cerkezi and Ozgun Cirakman and Bilge Gunsel},
journal= {arXiv preprint arXiv:2103.11017},
year = {2021}
}