ATCTrack:面向鲁棒视觉语言跟踪的动态目标状态对齐目标-上下文线索
计算机视觉与模式识别
2025-07-29 v1
摘要
视觉语言跟踪旨在使用模板块和初始帧中提供的语言描述在视频序列中定位目标对象。为实现鲁棒跟踪,尤其是反映真实世界条件的复杂长期场景(如MGIT所述),不仅要特征化目标,还要利用与目标相关的上下文特征。然而,来自初始提示的视觉和文本目标-上下文线索通常仅与初始目标状态对齐。由于目标状态的动态性,在复杂的长期序列中,这些状态不断变化。这些线索无法持续指导视觉语言跟踪器(VLTs)。此外,对于具有多样表达的文本提示,我们的实验表明,现有VLTs难以区分哪些单词与目标有关,哪些与上下文有关, complicating 上下文线索的利用。在本工作中,我们提出了新型跟踪器ATCTrack,通过综合的目标-上下文特征建模获得与动态目标状态对齐的多模态线索,从而实现鲁棒跟踪。具体而言:(1)对于视觉模态,我们提出了有效的时序视觉目标-上下文建模方法,为跟踪器提供及时的视觉线索。(2)对于文本模态,我们仅基于文本内容实现精确的目标词识别,并设计一种创新的上下文词校准方法,以适应性地利用辅助上下文词。(3)我们在主流基准测试上进行了大量实验,ATCTrack实现了新的SOTA性能。代码和模型将发布于:https://github.com/XiaokunFeng/ATCTrack。
引用
@article{arxiv.2507.19875,
title = {ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking},
author = {X. Feng and S. Hu and X. Li and D. Zhang and M. Wu and J. Zhang and X. Chen and K. Huang},
journal= {arXiv preprint arXiv:2507.19875},
year = {2025}
}
备注
Accepted by ICCV2025 Highlight ~