中文

POPCat:基于粒子传播的复杂标注任务方法

计算机视觉与模式识别 2024-06-26 v1

摘要

在面对唯一类别在视频序列中稠密分布时,为所有多目标跟踪、群体计数和工业级视频创建新数据集都十分困难且耗时。我们提出一种高效的方法,称为 POPCat,该方法利用视频数据的多目标和时序特征,构建用于分割或基于框的视频标注的半监督流程。该方法在保持人工水平标注准确度的同时,生成大量半监督标注,以实现更好的泛化。该方法通过使用粒子跟踪器利用时序特征,将人工提供的目标点扩展到标签帧所需的图像集合中。随后使用生成的数据训练 YOLO 模型,并对目标视频进行快速推断。在 GMOT-40、AnimalTrack 和 Visdrone-2019 数据集上进行评估。这些多目标视频跟踪/检测数据集包含多个相似外观的目标、摄像机运动等常见于“野外”情境的特征。我们特意选择这些困难数据集以展示该流程的有效性并进行比较。POPCat 在 GMOT-40、AnimalTrack 和 Visdrone 上的应用显示,在召回率/mAP50/mAP 指标上相较于最佳结果提升了 24.5%/9.6%/4.8%、-/43.1%/27.8% 和 7.5%/9.4%/7.5%。

关键词

引用

@article{arxiv.2406.17183,
  title  = {POPCat: Propagation of particles for complex annotation tasks},
  author = {Adam Srebrnjak Yang and Dheeraj Khanna and John S. Zelek},
  journal= {arXiv preprint arXiv:2406.17183},
  year   = {2024}
}

备注

10 pages, 5 figures, Accepted in "Conference on Robots and Vision 2024"