中文

从单点标注中学习跟踪表示

计算机视觉与模式识别 2024-04-16 v1

摘要

现有的深度跟踪器通常使用带有标注边界框的大规模视频帧进行训练。然而,这些边界框的标注既昂贵又耗时,尤其是对于大规模数据集。在本文中,我们提出以弱监督方式从单点标注(即标注速度比传统边界框快 4.5 倍)中学习跟踪表示。具体而言,我们提出了一种软对比学习(SoCL)框架,该框架将目标客观性先验融入端到端对比学习中。我们的 SoCL 包含自适应正负样本生成,这在学习跟踪表示时既节省内存又有效。我们将 SoCL 学习到的表示应用于视觉跟踪,并表明我们的方法能够:1) 在相同的标注时间成本下,取得优于使用边界框标注训练的全监督基线的性能;2) 通过使用相同数量的训练帧,取得与全监督基线相当的性能,同时将标注时间成本减少 78%,总费用减少 85%;3) 对标注噪声具有鲁棒性。

关键词

引用

@article{arxiv.2404.09504,
  title  = {Learning Tracking Representations from Single Point Annotations},
  author = {Qiangqiang Wu and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2404.09504},
  year   = {2024}
}

备注

Accept to CVPR2024-L3DIVU