GOT-JEPA:基于联合嵌入预测架构的通用目标跟踪与模型适应及遮挡处理
计算机视觉与模式识别
2026-03-19 v4 人工智能
机器学习
多媒体
神经与进化计算
摘要
人类视觉系统通过整合当前观察与先前观察的信息、适应目标和场景的变化,以及对遮挡进行精细推理来进行目标跟踪。相比之下,最近的通用目标跟踪器往往针对训练目标进行优化,限制了其在未见情景下的鲁棒性和泛化能力,其遮挡推理也相对粗糙,缺乏对遮挡模式的细致建模。为解决上述泛化和遮挡感知问题,我们提出了 GOT-JEPA,一个基于模型预测的预训练框架,将 JEPA 从预测图像特征扩展到预测跟踪模型。给定相同的历史信息,教师预测器从干净的当前帧生成伪跟踪模型,学生预测器则从被破坏版本的当前帧学习预测相同的伪跟踪模型。这种设计提供了稳定的伪监督,显式训练预测器在遮挡、干扰及其他不利观察下产生可靠的跟踪模型,从而提升对动态环境的泛化能力。基于 GOT-JEPA,我们进一步提出了 OccuSolver 来增强目标跟踪的遮挡感知。OccuSolver 将基于点中心的点跟踪器适配用于目标感知的可见性估计和细致的遮挡模式捕获。条件于跟踪器迭代生成的目标先验,OccuSolver 逐步细化可见性状态,加强遮挡处理,产生更高质量的参考标签,从而逐步改善后续模型预测。广泛的评估在七个基准数据集上表明,我们的方法有效提升了跟踪器的泛化性和鲁棒性。
引用
@article{arxiv.2602.14771,
title = {GOT-JEPA: Generic Object Tracking with Model Adaptation and Occlusion Handling using Joint-Embedding Predictive Architecture},
author = {Shih-Fang Chen and Jun-Cheng Chen and I-Hong Jhuo and Yen-Yu Lin},
journal= {arXiv preprint arXiv:2602.14771},
year = {2026}
}
备注
Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). This research focuses on learning model adaptation for adverse and dynamic environments, as well as fine-grained occlusion perception for tracking