中文

一体化:基于多模态对齐探索统一视觉-语言跟踪

计算机视觉与模式识别 2025-03-03 v2 人工智能

摘要

当前主流视觉-语言(VL)跟踪框架由三部分组成,即视觉特征提取器、语言特征提取器和融合模型。为追求更好性能,VL 跟踪的一种自然做法是采用定制且更重的单模态编码器和多模态融合模型。尽管有效,现有 VL 跟踪器将特征提取与特征整合分离,导致提取的特征缺乏语义引导,在相似干扰物和极端光照等复杂场景中目标感知能力有限。受近期利用统一架构的基础模型在自然语言和计算机视觉任务上取得成功的启发,我们提出一种一体化(All-in-One)框架,通过采用统一 transformer 骨干来学习联合特征提取与交互。具体而言,我们将原始视觉与语言信号混合以生成语言注入的视觉 token,随后在送入统一骨干架构前将其拼接。该方法在统一骨干中实现特征整合,免去精心设计的融合模块,从而形成更高效且有效的 VL 跟踪框架。为进一步提升学习效率,我们引入基于跨模态与模态内对比目标的多模态对齐模块,为统一的一体化 transformer 骨干提供更合理的表征。在 OTB99-L、TNL2K、LaSOT、LaSOTExt_{\rm Ext} 和 WebUAV-3M 五个基准上的大量实验证明了所提跟踪器相对于现有 VL 跟踪 SOTA 的优越性。代码将公开于 https://github.com/983632847/All-in-One。

关键词

引用

@article{arxiv.2307.03373,
  title  = {All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment},
  author = {Chunhui Zhang and Xin Sun and Yiqian Yang and Li Liu and Qiong Liu and Xi Zhou and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2307.03373},
  year   = {2025}
}

备注

In this version, we corrected some typos