弥合端到端与非端到端多目标跟踪之间的差距
计算机视觉与模式识别
2023-05-23 v1
摘要
现有端到端多目标跟踪(e2e-MOT)方法尚未超越非端到端的检测跟踪(tracking-by-detection)方法。一个潜在原因是其训练期间的标签分配策略持续将已跟踪对象与跟踪查询绑定,再将少数新出现对象分配给检测查询。在一对一二分匹配下,此类分配会导致训练不平衡,即检测查询的正样本稀少,尤其在封闭场景中,因为大多数新对象在视频开头即登场。因此,相较于其他检测跟踪方法,e2e-MOT 更容易产生无更新或重新初始化的跟踪终端。为缓解该问题,我们提出 Co-MOT,一种借助带影子概念的合作竞争标签分配来简易有效地促进 e2e-MOT 的方法。具体而言,在为中间解码器执行标签分配时,我们将已跟踪对象加入检测查询的匹配目标。对于查询初始化,我们通过一组对其自身扰动有限的影子对应项来扩展每个查询。大量消融实验表明,Co-MOT 在无额外开销下取得优越性能,例如在 DanceTrack 上 69.4% HOTA、在 BDD100K 上 52.8% TETA。令人印象深刻的是,Co-MOT 仅需 MOTRv2 的 38% FLOPs 即可达到相近性能,从而实现 1.4 更快的推理速度。
引用
@article{arxiv.2305.12724,
title = {Bridging the Gap Between End-to-end and Non-End-to-end Multi-Object Tracking},
author = {Feng Yan and Weixin Luo and Yujie Zhong and Yiyang Gan and Lin Ma},
journal= {arXiv preprint arXiv:2305.12724},
year = {2023}
}