中文

基于显式与隐式提示的多目标跟踪重构

计算机视觉与模式识别 2025-10-16 v1

摘要

多模态语义线索(如文本描述)在增强跟踪目标感知方面显示出强大的潜力。然而,现有方法依赖大型语言模型生成的静态文本描述,缺乏对实时目标状态变化的适应性,并且容易产生幻觉。为此,本文提出一种统一的多模态视觉-语言跟踪框架 EPIPTrack,利用显式提示与隐式提示进行动态目标建模与语义对齐。具体而言,显式提示将空间运动信息转化为自然语言描述,以提供时空指引;隐式提示则将伪词与可学习的描述符结合,以构建个性化知识表征,捕获外观属性。两类提示均通过 CLIP 文本编码器进行动态调整,以响应目标状态的变化。此外,本文设计了判别特征增强器,以提升视觉特征与跨模态表征。在 MOT17、MOT20 和 DanceTrack 上进行的广泛实验表明,EPIPTrack 在多种场景下超越现有跟踪器,展现出稳健的适应性与卓越的性能。

关键词

引用

@article{arxiv.2510.13235,
  title  = {EPIPTrack: Rethinking Prompt Modeling with Explicit and Implicit Prompts for Multi-Object Tracking},
  author = {Yukuan Zhang and Jiarui Zhao and Shangqing Nie and Jin Kuang and Shengsheng Wang},
  journal= {arXiv preprint arXiv:2510.13235},
  year   = {2025}
}