基于关联掩码建模的紧凑 Transformer 跟踪器
计算机视觉与模式识别
2023-01-27 v1
摘要
Transformer 框架凭借其以知名注意力机制跨模板与搜索图像聚合信息的强大能力,在视觉目标跟踪中展现出优越性能。近期多数进展聚焦于探索注意力机制变体以实现更好的信息聚合。我们发现这些方案等价于甚至仅是基础自注意力机制的子集。本文中,我们证明原始自注意力结构足以进行信息聚合,结构适配并无必要。关键不在于注意力结构,而在于如何提取用于跟踪的判别性特征并增强目标与搜索图像间的通信。基于该发现,我们采用基础视觉 Transformer(ViT)架构作为主跟踪器,并拼接模板与搜索图像以进行特征嵌入。为引导编码器捕获用于跟踪的不变特征,我们附加一个轻量关联掩码解码器,从相应掩码令牌重建原始模板与搜索图像。该关联掩码解码器作为紧凑 Transformer 跟踪器的插件,在推理时被跳过。我们的紧凑跟踪器采用最简结构,仅由 ViT 主干与边界框头组成,并可达到 40 fps。大量实验表明所提紧凑 Transformer 跟踪器优于现有方法(包括先进注意力变体),并证明了自注意力在跟踪任务中的充分性。我们的方法在五个具挑战性数据集及 VOT2020、UAV123、LaSOT、TrackingNet 与 GOT-10k 基准上取得最先进性能。我们的项目见 https://github.com/HUSTDML/CTTrack。
引用
@article{arxiv.2301.10938,
title = {Compact Transformer Tracker with Correlative Masked Modeling},
author = {Zikai Song and Run Luo and Junqing Yu and Yi-Ping Phoebe Chen and Wei Yang},
journal= {arXiv preprint arXiv:2301.10938},
year = {2023}
}
备注
AAAI2023 oral