一种用于视频目标分割的转导方法
计算机视觉与模式识别
2020-04-17 v2
摘要
半监督视频目标分割旨在给定第一帧掩码的情况下,从视频序列中分离出目标对象。当前主流方法大多利用在光流、实例分割等其他领域训练的额外模块的信息,因此无法与其他方法在同等条件下竞争。为解决此问题,我们提出了一种简单而强大的转导方法,其不需要额外模块、数据集以及专门的架构设计。我们的方法采用标签传播思路,基于嵌入空间中的特征相似度将像素标签向前传递。不同于其他传播方法,我们的方法以整体方式扩散时间信息,从而考虑对象的长期外观。此外,我们的方法仅需极少的额外计算开销,并以约 37 fps 的快速速度运行。我们采用普通 ResNet50 主干的单一模型在 DAVIS 2017 验证集上取得了 72.3 的总分,在测试集上取得了 63.1。这一简单而高性能且高效的方法可作为推动未来研究的坚实基线。代码与模型见 \url{https://github.com/microsoft/transductive-vos.pytorch}。
引用
@article{arxiv.2004.07193,
title = {A Transductive Approach for Video Object Segmentation},
author = {Yizhuo Zhang and Zhirong Wu and Houwen Peng and Stephen Lin},
journal= {arXiv preprint arXiv:2004.07193},
year = {2020}
}
备注
To Appear in CVPR 2020