面向自监督跟踪的解耦时空一致性学习
动力系统
2025-08-06 v3 概率论
摘要
视觉跟踪的成功在很大程度上依赖带有手动框注释的数据集。然而,这些框注释需要巨大的人力 effort,限制了现有跟踪数据集的规模和多样性。本文提出一种名为 \textbf{{\tracker}} 的新型自监督跟踪框架,以消除框注释需求。具体而言,提出一种解耦时空一致性训练框架,通过全局空间定位和局部时间关联在不同时间戳之间学习丰富的目标信息。这允许在真实场景中模拟目标的外观和运动变化。此外,设计了一种实例对比损失,从多视角角度学习实例级对应关系,在无需额外标签的情况下提供稳健的实例监督。这种新设计范式使 {\tracker} 能够以自监督方式有效学习通用跟踪表征,同时减少对大量框注释的依赖。在九个基准数据集上的大量实验表明,{\tracker} 在 AUC (AO) 分数上超越了 \textit{SOTA} 自监督跟踪方法,分别在 GOT10K、LaSOT、TrackingNet 数据集上提升了 25.3%、20.4% 和 14.8%。代码: https://github.com/GXNU-ZhongLab/SSTrack。
引用
@article{arxiv.2507.21605,
title = {On the Fourier transform of random Bernoulli convolutions},
author = {Simon Baker and Henna Koivusalo and Sascha Troscheit and Xintian Zhang},
journal= {arXiv preprint arXiv:2507.21605},
year = {2025}
}