中文

当少样本学习遇见视频目标检测

计算机视觉与模式识别 2022-08-19 v3

摘要

与静态图像不同,视频包含额外的时空信息以改进目标检测。然而,获取大量带有边界框标注的视频(监督深度学习所需)代价高昂。尽管人类仅通过观看少量视频片段即可轻松学会识别新物体,深度学习通常受困于过拟合。这引出一个重要问题:如何仅从少量标注视频片段中有效学习视频目标检测器?本文研究视频目标检测的少样本学习这一新问题。我们首先定义少样本设定,并基于广泛使用的 ImageNet VID 数据集创建了一个用于少样本视频目标检测的新基准数据集。我们采用迁移学习框架,在大量基类物体与少量新类物体视频片段上有效训练视频目标检测器。通过分析该框架下两种方法(Joint 与 Freeze)在我们设计的弱基与强基数据集上的结果,我们揭示了不足与过拟合问题。一个简单而有效的方法,称为 Thaw,被自然提出以权衡这两个问题并验证我们的分析。在我们提出的涵盖不同场景的基准数据集上的大量实验,证明了我们在这一新少样本视频目标检测问题中的新颖分析的有效性。

关键词

引用

@article{arxiv.2103.14724,
  title  = {When Few-Shot Learning Meets Video Object Detection},
  author = {Zhongjie Yu and Gaoang Wang and Lin Chen and Sebastian Raschka and Jiebo Luo},
  journal= {arXiv preprint arXiv:2103.14724},
  year   = {2022}
}

备注

Accepted at ICPR2022