中文

OVTR:基于 Transformer 的端到端开放词汇多目标跟踪

计算机视觉与模式识别 2025-04-01 v3

摘要

开放词汇多目标跟踪旨在使跟踪器在训练期间能够针对未见过的类别进行泛化,从而适用于各种实际场景。然而,现有的开放词汇跟踪器受限于其框架结构、孤立的帧级感知以及不足的模态交互,这些因素阻碍了其在开放词汇分类和跟踪方面的性能。本文提出 OVTR(基于 Transformer 的端到端开放词汇多目标跟踪),这是首个能够同时建模运动、外观和类别的端到端开放词汇跟踪器。为实现稳定的分类和连续的跟踪,我们设计了 CIP(类别信息传递)策略,为后续帧建立多个高层次类别信息先验。此外,我们引入双分支结构以实现泛化能力和深层模态交互,并在解码器中加入保护性策略以提升性能。实验结果表明,我们的方法在开放词汇 MOT 基准测试上超越了以前的跟踪器,同时实现了更快的推理速度和显著减少的预处理要求。此外,将模型迁移到另一个数据集的实验表明其具有强大的适应性。模型和代码已发布于 https://github.com/jinyanglii/OVTR。

关键词

引用

@article{arxiv.2503.10616,
  title  = {OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with Transformer},
  author = {Jinyang Li and En Yu and Sijia Chen and Wenbing Tao},
  journal= {arXiv preprint arXiv:2503.10616},
  year   = {2025}
}

备注

Accepted by ICLR 2025