关联所有检测对象:面向未知目标的跟踪检测统一框架
计算机视觉与模式识别
2025-08-05 v2
摘要
多目标跟踪(MOT)是计算机视觉领域一个关键且高度有前景的分支。经典的封闭词汇MOT(CV-MOT)方法旨在跟踪预定义类别的对象。最近,一些开放词汇MOT(OV-MOT)方法成功地解决了跟踪未知类别的问题。然而,我们发现CV-MOT和OV-MOT方法各自在对方的任务上都难以出类拔萃。本文提出了一个统一框架——Associate Everything Detected(AED),该框架同时处理CV-MOT和OV-MOT,通过与任何即插即用检测器集成并支持未知类别。与现有跟踪检测方法不同,AED摆脱了先验知识(如运动线索),仅依赖高度稳健的特征学习来处理OV-MOT中的复杂轨迹,同时保持在CV-MOT任务中的卓越性能。具体而言,我们将关联任务建模为相似度解码问题,提出了具有关联中心学习机制的 sim-decoder。sim-decoder 在三个方面计算相似度:空间、时间和跨剪辑。随后,关联中心学习利用这三重相似度确保提取的特征适合连续跟踪且足够稳健以泛化到未知类别。与现有强大的OV-MOT和CV-MOT方法相比,AED在 TAO、SportsMOT 和 DanceTrack 上取得优异性能,且无需任何先验知识。我们的代码已公开:https://github.com/balabooooo/AED。
引用
@article{arxiv.2409.09293,
title = {Associate Everything Detected: Facilitating Tracking-by-Detection to the Unknown},
author = {Zimeng Fang and Chao Liang and Xue Zhou and Shuyuan Zhu and Xi Li},
journal= {arXiv preprint arXiv:2409.09293},
year = {2025}
}
备注
Accepted by IEEE Transactions on Image Processing (TIP)