中文

COST:面向视觉-语言小目标跟踪的对比式一阶段 Transformer

计算机视觉与模式识别 2025-04-03 v1 人工智能

摘要

Transformer 最近在改进视觉-语言(VL)跟踪算法方面显示出巨大的潜力。然而,大多数现有的VL跟踪器都依赖于精心设计的机制来执行多阶段多模态融合。此外,直接在特征空间中进行多模态融合而不进行对齐,忽略了模态之间分布差异,可能导致次优的表示。在本工作中,我们提出了COST,一种用于VL跟踪的对比式一阶段Transformer融合框架,旨在学习语义上一致且统一的VL表示。具体而言,我们引入一种对比对齐策略,以最大化视频与其对应语言描述之间的互信息(MI)。这实现了有效的跨模态对齐,yielding语义上一致的特征。在视觉-语言Transformer的帮助下,我们建立了一个高效的多模态融合与推理机制,实证表明,一个简单的Transformer编码器堆叠即可有效实现统一的VL表示。此外,我们贡献了一个新收集的VL跟踪基准数据集,命名为VL-SOT500,包含边界框和语言描述。该数据集包含两个具有挑战性的子集,VL-SOT230和VL-SOT270,分别用于评估通用和高速小目标跟踪。小目标跟踪因其弱表征和有限特征而极具挑战性,鉴于目前尚无人将语言线索用于增强小目标视觉表示,VL-SOT500数据集应是首个尝试。广泛的实验表明,COST在五个现有VL跟踪数据集上以及我们提出的VL-SOT500数据集上均实现了最先进的性能。源代码和数据集将公开发布。

关键词

引用

@article{arxiv.2504.01321,
  title  = {COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking},
  author = {Chunhui Zhang and Li Liu and Jialin Gao and Xin Sun and Hao Wen and Xi Zhou and Shiming Ge and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2504.01321},
  year   = {2025}
}

备注

Preprint submitted to Elsevier. https://github.com/983632847/Awesome-Multimodal-Object-Tracking