中文

一种用于视频目标分割的转导方法

计算机视觉与模式识别 2020-04-17 v2

摘要

半监督视频目标分割旨在给定第一帧掩码的情况下,从视频序列中分离出目标对象。当前主流方法大多利用在光流、实例分割等其他领域训练的额外模块的信息,因此无法与其他方法在同等条件下竞争。为解决此问题,我们提出了一种简单而强大的转导方法,其不需要额外模块、数据集以及专门的架构设计。我们的方法采用标签传播思路,基于嵌入空间中的特征相似度将像素标签向前传递。不同于其他传播方法,我们的方法以整体方式扩散时间信息,从而考虑对象的长期外观。此外,我们的方法仅需极少的额外计算开销,并以约 \sim37 fps 的快速速度运行。我们采用普通 ResNet50 主干的单一模型在 DAVIS 2017 验证集上取得了 72.3 的总分,在测试集上取得了 63.1。这一简单而高性能且高效的方法可作为推动未来研究的坚实基线。代码与模型见 \url{https://github.com/microsoft/transductive-vos.pytorch}。

关键词

引用

@article{arxiv.2004.07193,
  title  = {A Transductive Approach for Video Object Segmentation},
  author = {Yizhuo Zhang and Zhirong Wu and Houwen Peng and Stephen Lin},
  journal= {arXiv preprint arXiv:2004.07193},
  year   = {2020}
}

备注

To Appear in CVPR 2020