中文

SSVOD:基于稀疏标注的半监督视频目标检测

计算机视觉与模式识别 2023-11-14 v1

摘要

尽管图像目标检测的半监督学习取得了显著进展,视频目标检测仍有若干关键问题有待解决:(1)有监督视频目标检测的良好性能高度依赖于标注帧的可用性。(2)尽管视频帧间具有高度相关性,为每视频大量帧收集标注昂贵、耗时且常显冗余。(3)现有的静态图像半监督技术难以利用视频中固有存在的时间运动动态。本文中,我们提出SSVOD,一种端到端半监督视频目标检测框架,利用视频的运动动态以稀疏标注来使用大规模未标注帧。为跨帧组选择性地组装鲁棒伪标签,我们引入来自邻近帧的\textit{光流扭曲预测}用于时间一致性估计。特别地,我们在一组估计预测上引入基于交叉IoU和交叉散度的选择方法,分别用于包含边界框和类别标签的鲁棒伪标签。为在伪标签的确认偏差与不确定性噪声间取得平衡,我们提出基于置信度阈值的硬伪标签与软伪标签组合。我们的方法在ImageNet-VID、Epic-KITCHENS和YouTube-VIS数据集上相较现有方法取得显著性能提升。代码与预训练模型将公开。

关键词

引用

@article{arxiv.2309.01391,
  title  = {SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations},
  author = {Tanvir Mahmud and Chun-Hao Liu and Burhaneddin Yaman and Diana Marculescu},
  journal= {arXiv preprint arXiv:2309.01391},
  year   = {2023}
}