中文

基于运动感知掩码传播的自监督视频对象分割

计算机视觉与模式识别 2021-10-29 v2

摘要

我们提出一种自监督时空匹配方法,称为运动感知掩码传播(Motion-Aware Mask Propagation,MAMP),用于视频对象分割。MAMP 利用帧重建任务进行训练,无需标注。在推理时,MAMP 从每帧提取高分辨率特征,并基于所选过去帧的特征及预测掩码构建记忆库。随后,MAMP 根据我们提出的运动感知时空匹配模块,将记忆库中的掩码传播至后续帧,以应对快速运动与长时匹配场景。在 DAVIS-2017 与 YouTube-VOS 数据集上的评估表明,与现有自监督方法相比,MAMP 取得了最先进的性能且具备更强的泛化能力,即在 DAVIS-2017 上平均 J&F 比最接近的竞争对手高 4.2%,在 YouTube-VOS 的未见类别上平均 J&F 高 4.85%。此外,MAMP 的性能与许多有监督视频对象分割方法相当。我们的代码见:https://github.com/bo-miao/MAMP。

关键词

引用

@article{arxiv.2107.12569,
  title  = {Self-Supervised Video Object Segmentation by Motion-Aware Mask Propagation},
  author = {Bo Miao and Mohammed Bennamoun and Yongsheng Gao and Ajmal Mian},
  journal= {arXiv preprint arXiv:2107.12569},
  year   = {2021}
}