将更多注意力转向视觉-语言目标跟踪
计算机视觉与模式识别
2023-07-20 v1
摘要
多模态视觉-语言(VL)学习凭借新兴的大型基础模型显著推动了通用智能的发展。然而,跟踪作为基础视觉问题,令人惊讶地较少从近期繁荣的 VL 学习中获益。我们认为原因有二:缺乏大规模视觉-语言标注视频,以及现有工作的视觉-语言交互学习低效。这些困扰促使我们为跟踪设计更有效的视觉-语言表示,同时构建带语言标注的大型数据库用于模型学习。具体而言,本文首先提出一种通用属性标注策略来装饰六个流行跟踪基准中的视频,由此贡献了一个含逾 23,000 段视频的大规模视觉-语言跟踪数据库。我们随后引入一种新框架,通过学习统一自适应 VL 表示来改进跟踪,其核心为所提出的不对称架构搜索与模态混合器(ModaMixer)。为进一步提升 VL 表示,我们引入对比损失以对齐不同模态。为充分证明方法有效性,我们将所提框架集成于三种不同设计的跟踪方法上,即基于 CNN 的 SiamCAR、基于 Transformer 的 OSTrack 与混合结构 TransT。实验表明我们的框架在六个基准上均能显著提升所有基线。除经验结果外,我们从理论上分析了方法以彰显其合理性。通过揭示 VL 表示的潜力,我们期望学界将更多注意力转向 VL 跟踪,并希望为未来借助多样化多模态信息的跟踪开辟更多可能。
引用
@article{arxiv.2307.10046,
title = {Divert More Attention to Vision-Language Object Tracking},
author = {Mingzhe Guo and Zhipeng Zhang and Liping Jing and Haibin Ling and Heng Fan},
journal= {arXiv preprint arXiv:2307.10046},
year = {2023}
}
备注
16 pages, 9 figures