利用幻觉视频与无标签视频进行多目标跟踪
计算机视觉与模式识别
2021-08-20 v1
摘要
在本文中,我们探索在没有跟踪标注的情况下学习端到端深度神经跟踪器。这一点很重要,因为大规模训练数据对于训练深度神经跟踪器至关重要,而跟踪标注的获取成本高昂。作为跟踪标注的替代,我们首先利用缩放运动变换从带有边界框标注的图像中幻觉出视频,从而获得免费的跟踪标签。我们添加视频仿真增强以创建一个多样化的跟踪数据集,尽管其运动较为简单。接下来,为了应对更难的跟踪情况,我们使用在幻觉视频数据上训练的跟踪器,在一个无标签真实视频池中挖掘困难样本。对于困难样本挖掘,我们提出了一种基于优化的连接过程,以先识别再纠正无标签视频池中的困难样本。最后,我们在幻觉数据和挖掘出的困难视频样本上联合训练跟踪器。我们的弱监督跟踪器在 MOT17 和 TAO-person 数据集上取得了最先进的性能。在 MOT17 上,我们进一步证明,将我们自生成的数据与现有手动标注数据结合可带来额外的提升。
引用
@article{arxiv.2108.08836,
title = {Multi-Object Tracking with Hallucinated and Unlabeled Videos},
author = {Daniel McKee and Bing Shuai and Andrew Berneshawi and Manchen Wang and Davide Modolo and Svetlana Lazebnik and Joseph Tighe},
journal= {arXiv preprint arXiv:2108.08836},
year = {2021}
}