中文

面向Transformer跟踪的上下文感知Token修剪与判别性选择性注意

计算机视觉与模式识别 2025-11-26 v1

摘要

单流式基于Transformer的跟踪器通过拼接模板和搜索区域的token,实现了所有token之间的联合注意,展现了卓越的性能。然而,使过大比例的背景搜索token注意模板token,削弱了跟踪器的判别能力。虽已提出多种token修剪方法以缓解背景干扰,但往往会去除靠近目标的token,导致关键上下文信息丢失并降低跟踪性能。此外,搜索token中存在的干扰物进一步降低了跟踪器准确识别目标的能力。为此,本文提出一种名为CPDATrack的新型跟踪框架,旨在抑制背景和干扰物token的干扰,同时提升计算效率。首先,在两个指定编码器层之间集成一个可学习模块,估计每个搜索token与目标关联的概率。基于这些估计值,对搜索区域进行修剪,保留目标周围的上下文线索。为进一步抑制背景干扰,采用判别性选择性注意机制,在早期层完全阻断搜索到模板的注意。随后在后续编码器层,从局部区域中提取高概率目标token,以注意模板token,从而减少背景和干扰物token的影响。所提出的CPDATrack在多个基准上实现了最先进的性能,尤其在GOT-10k上达到了75.1%的平均重叠度.

关键词

引用

@article{arxiv.2511.19928,
  title  = {Context-Aware Token Pruning and Discriminative Selective Attention for Transformer Tracking},
  author = {Janani Kugarajeevan and Thanikasalam Kokul and Amirthalingam Ramanan and Subha Fernando},
  journal= {arXiv preprint arXiv:2511.19928},
  year   = {2025}
}