用于视觉跟踪的鲁棒目标建模
计算机视觉与模式识别
2023-08-11 v1
摘要
目标建模已成为近期跟踪框架的核心部分。当前流行的跟踪器使用 Transformer 注意力来单独或与搜索区域交互地提取模板特征。然而,单独的模板学习缺乏模板与搜索区域之间的通信,这给提取有判别力的面向目标的特征带来困难。另一方面,交互式模板学习产生混合模板特征,可能通过杂乱的搜索区域向模板引入潜在干扰物。为兼顾两种方法之长,我们提出一种用于视觉跟踪的鲁棒目标建模框架(ROMTrack),其同时建模固有模板与混合模板特征。结果,通过将目标对象的固有特征与搜索区域引导相结合,有害干扰物可被抑制。目标相关特征也可利用混合模板提取,从而形成更鲁棒的目标建模框架。为进一步增强鲁棒性,我们提出新颖的变化令牌以刻画目标对象不断变化的外观。变化令牌可适应目标形变与外观变化,能以可忽略的计算量提升整体性能。实验表明,我们的 ROMTrack 在多个基准上确立了新的最先进水平。
引用
@article{arxiv.2308.05140,
title = {Robust Object Modeling for Visual Tracking},
author = {Yidong Cai and Jie Liu and Jie Tang and Gangshan Wu},
journal= {arXiv preprint arXiv:2308.05140},
year = {2023}
}
备注
Accepted by ICCV2023. 19 pages. Code is available at https://github.com/dawnyc/ROMTrack