基于对比学习的视觉与视觉-语言统一跟踪
计算机视觉与模式识别
2024-01-23 v1
摘要
单目标跟踪旨在根据不同模态参考指定的状态定位视频序列中的目标对象,这些参考包括初始边界框(BBOX)、自然语言(NL)或两者兼有(NL+BBOX)。由于不同模态之间的差异,大多数现有跟踪器仅针对这些参考设置中的单一或部分进行设计,并在特定模态上过度特化。不同的是,我们提出了一种名为 UVLTrack 的统一跟踪器,它能够以相同的参数同时处理所有三种参考设置(BBOX、NL、NL+BBOX)。所提出的 UVLTrack 具有若干优点。首先,我们设计了一个模态统一特征提取器,用于联合视觉和语言特征学习,并提出了一种多模态对比损失,将视觉和语言特征对齐到统一的语义空间中。其次,提出了一种模态自适应边界框头,充分利用目标参考从视频上下文中动态挖掘不断变化的场景特征,并以对比方式区分目标,从而在不同参考设置下实现稳健的性能。大量实验结果表明,UVLTrack 在七个视觉跟踪数据集、三个视觉-语言跟踪数据集和三个视觉定位数据集上均取得了令人满意的性能。代码和模型将在 https://github.com/OpenSpaceAI/UVLTrack 开源。
引用
@article{arxiv.2401.11228,
title = {Unifying Visual and Vision-Language Tracking via Contrastive Learning},
author = {Yinchao Ma and Yuyang Tang and Wenfei Yang and Tianzhu Zhang and Jinpeng Zhang and Mengxue Kang},
journal= {arXiv preprint arXiv:2401.11228},
year = {2024}
}