CiteTracker:通过关联图像与文本实现视觉跟踪
计算机视觉与模式识别
2023-08-23 v1
摘要
现有的视觉跟踪方法通常将图像块作为目标的参考来进行跟踪。然而,单个图像块无法提供目标对象的完整且精确的概念,因为图像在抽象能力上有限且可能存在歧义,这使得跟踪具有剧烈变化的目标变得困难。在本文中,我们提出 CiteTracker,通过连接图像与文本来增强视觉跟踪中的目标建模与推断。具体而言,我们开发了一个文本生成模块,将目标图像块转换为包含其类别和属性信息的描述性文本,为目标提供全面的参考点。此外,设计了一个动态描述模块以适应目标变化,实现更有效的目标表示。随后,我们使用基于注意力的关联模块将目标描述与搜索图像相关联,生成用于目标状态参考的关联特征。在五个不同数据集上的大量实验评估了所提出的算法,其与最先进方法相比的优越性能证明了该跟踪方法的有效性。
引用
@article{arxiv.2308.11322,
title = {CiteTracker: Correlating Image and Text for Visual Tracking},
author = {Xin Li and Yuqing Huang and Zhenyu He and Yaowei Wang and Huchuan Lu and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2308.11322},
year = {2023}
}
备注
accepted by ICCV 2023