RVOS:用于视频目标分割的端到端循环网络
计算机视觉与模式识别
2019-05-22 v2
摘要
多目标视频目标分割是一项具有挑战性的任务,尤其在零样本情形下——初始帧未给出目标掩码,模型须沿序列自行发现待分割目标。在我们的工作中,我们提出一种用于多目标视频目标分割的循环网络(RVOS),其完全可端到端训练。我们的模型在两种不同域上引入循环:(i)空间域,用以在一帧内发现不同目标实例;(ii)时间域,用以保持分割目标随时间的连贯性。我们训练 RVOS 用于零样本视频目标分割,并率先报告了 DAVIS-2017 与 YouTube-VOS 基准的定量结果。此外,我们将 RVOS 适配于单样本视频目标分割,方法是将先前时间步获得的掩码作为由循环模块处理的输入。我们的模型在 YouTube-VOS 基准上达到与 SOTA 技术相当的结果,并在 DAVIS-2017 基准上优于所有未使用在线学习的已有视频目标分割方法。而且,我们的模型推理运行速度快于先前方法,在 P100 GPU 上达到 44ms/帧。
引用
@article{arxiv.1903.05612,
title = {RVOS: End-to-End Recurrent Network for Video Object Segmentation},
author = {Carles Ventura and Miriam Bellver and Andreu Girbau and Amaia Salvador and Ferran Marques and Xavier Giro-i-Nieto},
journal= {arXiv preprint arXiv:1903.05612},
year = {2019}
}
备注
CVPR 2019 camera ready. Project website: https://imatge-upc.github.io/rvos/