中文

双样本视频目标分割

计算机视觉与模式识别 2023-03-22 v1

摘要

已有的视频目标分割(VOS)工作均在密集标注的视频上训练。然而,获取像素级标注昂贵且耗时。本文中,我们证明了在稀疏标注视频上训练出令人满意的 VOS 模型的可行性——每支训练视频仅需两帧标注即可维持性能。我们将这一新颖训练范式称为双样本视频目标分割,简称双样本 VOS。其底层思路是在训练过程中为未标注帧生成伪标签,并在标注与伪标注数据的组合上优化模型。我们的方法极为简单,可应用于绝大多数现有框架。我们首先以半监督方式在稀疏标注视频上预训练一个 VOS 模型,其中第一帧始终为标注帧。随后,我们采用预训练的 VOS 模型为所有未标注帧生成伪标签,并将其存入伪标签库。最后,我们在标注与伪标注数据上重新训练一个 VOS 模型,且对第一帧无任何限制。我们首次提出了一种在双样本 VOS 数据集上训练 VOS 模型的通用方法。通过使用 YouTube-VOS 和 DAVIS 基准中 7.3% 和 2.9% 的标注数据,我们的方法取得了与在完全标注集上训练的同类方法相当的结果。代码与模型见 https://github.com/yk-pku/Two-shot-Video-Object-Segmentation。

关键词

引用

@article{arxiv.2303.12078,
  title  = {Two-shot Video Object Segmentation},
  author = {Kun Yan and Xiao Li and Fangyun Wei and Jinglu Wang and Chenbin Zhang and Ping Wang and Yan Lu},
  journal= {arXiv preprint arXiv:2303.12078},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Code and models are available at https://github.com/yk-pku/Two-shot-Video-Object-Segmentation