统一跟踪与图像-视频目标检测
计算机视觉与模式识别
2023-11-21 v2
摘要
目标检测(OD)一直是计算机视觉中最基础的任务之一。深度学习的最新进展通过基于学习、数据驱动的方法将图像目标检测的性能推向了新的高度。另一方面,视频目标检测探索较少,主要由于数据标注成本高得多。同时,多目标跟踪(MOT)需要对跟踪身份和时空轨迹进行推理,与视频目标检测有相似理念。然而,大多数MOT数据集是特定类别的(例如仅标注人),这限制了模型在其他物体上执行跟踪的灵活性。我们提出TrIVD(Tracking and Image-Video Detection),首个在单一端到端模型中统一图像目标检测、视频目标检测和多目标跟踪的框架。为处理跨数据集类别标签的差异和语义重叠,TrIVD将检测/跟踪表述为定位(grounding)并通过视觉-文本对齐推理物体类别。该统一公式支持跨数据集、多任务训练,从而赋予TrIVD利用帧级特征、视频级时空关系以及跟踪身份关联的能力。通过这种联合训练,我们现在可以将来自具有更丰富物体类别标注的目标检测数据的知识扩展到MOT,并实现零样本跟踪能力。实验表明,多任务协同训练的TrIVD在所有图像/视频目标检测和MOT任务上均优于单任务基线。我们进一步在新任务零样本跟踪上设立了首个基线。
引用
@article{arxiv.2211.11077,
title = {Unifying Tracking and Image-Video Object Detection},
author = {Peirong Liu and Rui Wang and Pengchuan Zhang and Omid Poursaeed and Yipin Zhou and Xuefei Cao and Sreya Dutta Roy and Ashish Shah and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2211.11077},
year = {2023}
}