ProContEXT:探索用于跟踪的渐进式上下文 Transformer
计算机视觉与模式识别
2023-03-31 v4 人工智能
多媒体
摘要
现有的视觉目标跟踪 (VOT) 仅将第一帧中的目标区域作为模板。这导致在快速变化和拥挤场景中跟踪不可避免地失败,因为它无法考虑帧间目标外观的变化。为此,我们用渐进式上下文编码 Transformer 跟踪器 (ProContEXT) 改进了跟踪框架,其连贯地利用空间与时间上下文来预测目标运动轨迹。具体而言,ProContEXT 利用上下文感知自注意力模块来编码空间与时间上下文,精炼并更新多尺度静态与动态模板以渐进式地执行准确跟踪。它探索了空间与时间上下文之间的互补性,为基于 Transformer 的跟踪器提出了多上下文建模的新路径。此外,ProContEXT 改进了令牌剪枝技术以降低计算复杂度。在 GOT-10k 和 TrackingNet 等流行基准数据集上的大量实验表明,所提出的 ProContEXT 达到了最先进的性能。
引用
@article{arxiv.2210.15511,
title = {ProContEXT: Exploring Progressive Context Transformer for Tracking},
author = {Jin-Peng Lan and Zhi-Qi Cheng and Jun-Yan He and Chenyang Li and Bin Luo and Xu Bao and Wangmeng Xiang and Yifeng Geng and Xuansong Xie},
journal= {arXiv preprint arXiv:2210.15511},
year = {2023}
}
备注
Accepted at ICASSP 2023, source code is at https://github.com/zhiqic/ProContEXT