中文

超越视觉线索:同步探索以目标为中心的语义用于视觉-语言跟踪

计算机视觉与模式识别 2024-02-20 v2

摘要

单目标跟踪旨在给定初始状态后于视频序列中定位特定目标。经典跟踪器仅依赖视觉线索,限制了其处理外观变化、歧义与干扰等挑战的能力。因此,视觉-语言(VL)跟踪作为一种有前景的方法应运而生,其引入语言描述以直接提供高层语义并提升跟踪性能。然而,当前的 VL 跟踪器尚未充分利用 VL 学习的潜力,因为它们受制于诸如严重依赖现成骨干网络进行特征提取、VL 融合设计低效以及缺乏 VL 相关损失函数等局限。为此,我们提出一种新颖的跟踪器,逐步探索以目标为中心的语义用于 VL 跟踪。具体而言,我们提出了首个用于 VL 跟踪的同步学习骨干网络(SLB),其由两个新颖模块组成:目标增强模块(TEM)与语义感知模块(SAM)。这些模块使跟踪器能够以相同节奏感知目标相关语义并理解视觉与文本模态的上下文,从而促进不同语义层级上的 VL 特征提取与融合。此外,我们设计了密集匹配损失以进一步强化多模态表示学习。在 VL 跟踪数据集上的大量实验证明了我们方法的优越性与有效性。

关键词

引用

@article{arxiv.2311.17085,
  title  = {Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking},
  author = {Jiawei Ge and Xiangmei Chen and Jiuxin Cao and Xuelin Zhu and Bo Liu},
  journal= {arXiv preprint arXiv:2311.17085},
  year   = {2024}
}