中文

基于 Transformer 的多目标跟踪对比学习

计算机视觉与模式识别 2025-05-16 v1

摘要

DEtection TRansformer(DETR)通过将目标检测建模为翻译任务——将图像特征转换为目标级表示——为对象检测开辟了新可能。先前工作通常向 DETR 添加昂贵模块以执行多目标跟踪(MOT),导致架构更为复杂。我们则展示如何通过采用实例级对比损失、改进的采样策略和轻量分配方法,将 DETR 转变为 MOT 模型。我们的训练方案在学习对象外观的同时保留检测能力且开销极小。其性能在具有挑战性的 BDD100K 数据集上以 +2.6 mMOTA 超越先前最优(SOTA),并在 MOT17 数据集上与现有基于 transformer 的方法相当。

关键词

引用

@article{arxiv.2311.08043,
  title  = {Contrastive Learning for Multi-Object Tracking with Transformers},
  author = {Pierre-François De Plaen and Nicola Marinello and Marc Proesmans and Tinne Tuytelaars and Luc Van Gool},
  journal= {arXiv preprint arXiv:2311.08043},
  year   = {2025}
}

备注

WACV 2024