视频目标分割的单次训练
计算机视觉与模式识别
2024-05-24 v1
摘要
视频目标分割(VOS)旨在根据目标对象的初始标注帧,在视频帧间跟踪并分割对象。以往的VOS工作通常依赖完全标注的视频进行训练。然而,为VOS获取完全标注的训练视频劳动密集且耗时。同时,自监督VOS方法尝试通过对应学习和标签传播来构建VOS系统,但缺乏掩码先验损害了其在复杂场景下的鲁棒性,且标签传播范式使其在效率上不实用。为解决这些问题,我们首次提出了一种通用的VOS单次训练框架,每个训练视频仅需一个标注帧,并适用于大多数最先进的VOS网络。具体而言,我们的算法包括:i) 基于初始标注帧向前推断对象掩码;ii) 利用步骤i)中的掩码向后重建初始对象掩码。通过这种双向训练,可以获得令人满意的VOS网络。值得注意的是,我们的方法极其简单,可以端到端使用。最后,我们的方法仅使用YouTube-VOS和DAVIS数据集的一个标注帧,就取得了与在完全标注数据集上训练相当的结果。代码将公开发布。
引用
@article{arxiv.2405.14010,
title = {One-shot Training for Video Object Segmentation},
author = {Baiyu Chen and Sixian Chan and Xiaoqin Zhang},
journal= {arXiv preprint arXiv:2405.14010},
year = {2024}
}
备注
Under review. Code will be release on https://github.com/supgb