RPM-Net:用于自监督视频目标分割的鲁棒像素级匹配网络
计算机视觉与模式识别
2019-10-11 v2
摘要
在本文中,我们介绍了一种无需人工标注数据的自监督视频目标分割方法。具体而言,我们提出鲁棒像素级匹配网络(RPM-Net),一种新颖的深度架构,它在相邻帧之间匹配像素,仅使用未标注视频的颜色信息进行训练。从技术上讲,RPM-Net 可分为两个主要模块。嵌入模块首先将输入图像投影到高维嵌入空间。然后,带有可变形卷积层的匹配模块基于嵌入特征在参考帧与目标帧之间匹配像素。与以往使用可变形卷积的方法不同,我们的匹配模块采用可变形卷积聚焦于时空邻域像素中的相似特征。我们的实验表明,选择性特征采样提升了对视频目标分割中相机抖动、快速运动、形变和遮挡等挑战性问题的鲁棒性。此外,我们在三个公开数据集(即 DAVIS-2017、SegTrack-v2 和 Youtube-Objects)上进行了综合实验,并在自监督视频目标分割上取得了最先进的性能。而且,我们显著缩小了自监督与全监督视频目标分割之间的性能差距(在 DAVIS-2017 验证集上为 41.0% 对比 52.5%)。
引用
@article{arxiv.1909.13247,
title = {RPM-Net: Robust Pixel-Level Matching Networks for Self-Supervised Video Object Segmentation},
author = {Youngeun Kim and Seokeon Choi and Hankyeol Lee and Taekyung Kim and Changick Kim},
journal= {arXiv preprint arXiv:1909.13247},
year = {2019}
}