通过上下文提示与噪声学习提升自监督跟踪
计算机视觉与模式识别
2026-05-08 v1
摘要
从无标签视频中学习鲁棒的上下文知识是推进自监督跟踪的关键课题。然而,常规自监督跟踪器缺乏有效的上下文建模,而基于非语义查询的现有上下文关联方法难以适应无标签跟踪场景,从而难以学习可靠的上下文线索。本文提出一种新型自监督跟踪框架,命名为 \tracker,引入双模态上下文关联机制,联合利用细粒度语义提示和上下文噪声,以驱动模型学习鲁棒的跟踪表征。遵循易到难的学习原则,本文的上下文关联机制包含两个阶段:在早期训练中,将实例块标记(提示)分配给前向与反向跟踪分支,以促进跟踪知识的获取;随着训练推进,逐渐注入上下文噪声以扰动特征,从而在更复杂的特征空间中鼓励跟踪器学习鲁棒的跟踪表征。如此, novel 的上下文关联机制使 our self-supervised 模型能够从无标签视频中学习高质量的跟踪表征,而仅在训练时应用,保持推理效率。广泛实验表明,我们的方法具有优势。
引用
@article{arxiv.2605.06092,
title = {Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning},
author = {Yaozong Zheng and Qihua Liang and Bineng Zhong and Shuimu Zeng and Yuanliang Xue and Ning Li and Shuxiang Song},
journal= {arXiv preprint arXiv:2605.06092},
year = {2026}
}
备注
CVPR 2026