预测 N 个最佳视觉跟踪器
摘要
我们观察到,SOTA 视觉跟踪器的性能在不同的视频属性和数据集之间呈现出显著的强烈变化。没有任何单个跟踪器在所有跟踪属性和数据集上都能保持最佳性能。为弥合这一差距,针对给定的视频序列,我们预测其 "N 个最佳跟踪器" (Best of N Trackers, BofN),即该序列的最佳跟踪器。其核心是跟踪性能预测网络 (Tracking Performance Prediction Network, TP2N),它仅利用少数初始帧即可为给定视频序列选择预测的最佳执行的视觉跟踪器。我们还引入了基于帧的 BofN 元跟踪器,通过定期的时间间隔持续预测最佳执行者。TP2N 基于自监督学习架构 MocoV2、SwAv、BT 和 DINO;实验表明,DINO 以 ViT-S 为背bone的性能最佳。视频级别的 BofN 元跟踪器在九个标准基准数据集上 (LaSOT、TrackingNet、GOT-10K、VOT2019、VOT2021、VOT2022、UAV123、OTB100 和 WebUAV-3M) 超越了现有 SOTA 跟踪器,优势显著。通过有效处理长序列内跟踪情景的变化,基于帧的 BofN 元跟踪器获得了进一步的改进。例如,在 GOT-10k 上,BofN 元跟踪器的平均重叠度分别为 88.7% 和 91.1%(分别采用视频级别和帧级别设置)。最佳执行跟踪器 RTS 实现了 85.20% 的 AO。 在 VOT2022 上,BofN 的预期平均重叠度分别为 67.88% 和 70.98%(分别采用视频和帧级别设置),相较于最佳执行 ARTrack 的 64.12% 显著提升。本 work 还对所有常用基准数据集上竞争性跟踪方法进行了广泛评估,遵循其各自的协议。代码、训练好的模型和结果将很快在 https://github.com/BasitAlawode/Best_of_N_Trackers 上公开。
引用
@article{arxiv.2407.15707,
title = {Predicting the Best of N Visual Trackers},
author = {Basit Alawode and Sajid Javed and Arif Mahmood and Jiri Matas},
journal= {arXiv preprint arXiv:2407.15707},
year = {2024}
}