中文

ChatTracker:通过与多模态大语言模型对话提升视觉跟踪性能

计算机视觉与模式识别 2024-12-17 v2

摘要

视觉目标跟踪旨在根据初始边界框在视频序列中定位目标对象。最近,视觉-语言(VL)跟踪器提出利用额外的自然语言描述来增强各种应用的通用性。然而,VL跟踪器在跟踪性能方面仍不及最先进的(SOTA)视觉跟踪器。我们发现,这种劣势主要源于其对人工文本标注的严重依赖,包括频繁提供模糊的语言描述。在本文中,我们提出ChatTracker,利用多模态大语言模型(MLLM)中丰富的世界知识来生成高质量的语言描述并提升跟踪性能。为此,我们提出了一种基于反射的提示优化模块,通过跟踪反馈迭代优化目标的模糊和不准确描述。为进一步利用MLLM产生的语义信息,我们提出了一种简单而有效的VL跟踪框架,可以作为即插即用模块轻松集成,以提升VL跟踪器和视觉跟踪器的性能。实验结果表明,所提出的ChatTracker达到了与现有方法相当的性能。

关键词

引用

@article{arxiv.2411.01756,
  title  = {ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model},
  author = {Yiming Sun and Fan Yu and Shaoxiang Chen and Yu Zhang and Junwei Huang and Chenhui Li and Yang Li and Changbo Wang},
  journal= {arXiv preprint arXiv:2411.01756},
  year   = {2024}
}