OneTracker:将视觉对象跟踪与基础模型统一的框架与高效调优
计算机视觉与模式识别
2024-03-15 v1
摘要
视觉对象跟踪旨在基于前帧中初始外观在后续帧中定位目标对象。根据输入模态不同,跟踪任务可分为RGB跟踪和RGB+X(例如RGB+N和RGB+D)跟踪。尽管不同输入模态存在差异,但跟踪的核心是时序匹配。基于这一共性,我们提出了统一各种跟踪任务的通用框架,称为OneTracker。OneTracker首先在称为Foundation Tracker的RGB跟踪器上进行大规模预训练。此预训练阶段使Foundation Tracker具备稳定的目标对象位置估计能力。随后我们将其他模态信息作为提示,基于Foundation Tracker构建Prompt Tracker。通过冻结Foundation Tracker仅调整部分额外可训练参数,Prompt Tracker抑制Foundation Tracker的强定位能力,在下游RGB+X跟踪任务上实现参数高效微调。为评估OneTracker(由Foundation Tracker和Prompt Tracker组成)的有效性,我们在6个流行跟踪任务上的11个基准上进行了广泛实验,OneTracker超越其他模型,实现了最先进的性能。
引用
@article{arxiv.2403.09634,
title = {OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning},
author = {Lingyi Hong and Shilin Yan and Renrui Zhang and Wanyun Li and Xinyu Zhou and Pinxue Guo and Kaixun Jiang and Yiting Chen and Jinglun Li and Zhaoyu Chen and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2403.09634},
year = {2024}
}
备注
Accepted to CVPR 2024