基于 Transformer 的多目标跟踪对比学习
计算机视觉与模式识别
2025-05-16 v1
摘要
DEtection TRansformer(DETR)通过将目标检测建模为翻译任务——将图像特征转换为目标级表示——为对象检测开辟了新可能。先前工作通常向 DETR 添加昂贵模块以执行多目标跟踪(MOT),导致架构更为复杂。我们则展示如何通过采用实例级对比损失、改进的采样策略和轻量分配方法,将 DETR 转变为 MOT 模型。我们的训练方案在学习对象外观的同时保留检测能力且开销极小。其性能在具有挑战性的 BDD100K 数据集上以 +2.6 mMOTA 超越先前最优(SOTA),并在 MOT17 数据集上与现有基于 transformer 的方法相当。
引用
@article{arxiv.2311.08043,
title = {Contrastive Learning for Multi-Object Tracking with Transformers},
author = {Pierre-François De Plaen and Nicola Marinello and Marc Proesmans and Tinne Tuytelaars and Luc Van Gool},
journal= {arXiv preprint arXiv:2311.08043},
year = {2025}
}
备注
WACV 2024