单次弱监督视频对象分割
计算机视觉与模式识别
2019-12-20 v1
摘要
传统的少样本对象分割方法从少量带有强标签分割掩码的支持图像中学习对象分割。近期工作表明,在涂鸦和边界框等较弱监督层级下也能达到相当性能。然而,针对使用图像级监督的少样本对象分割问题,关注有限。我们提出了一种用于少样本对象分割的新型多模态交互模块,其利用基于视觉与词嵌入的共注意力机制。这使我们的模型相比此前提出的图像级少样本对象分割提升了 5.1%。我们的方法与使用强监督的最先进方法表现相对接近,而我们使用了尽可能最少的监督。我们进一步提出了一种新颖的少样本弱监督视频对象分割(VOS)设定,其仅依赖第一帧的图像级标签。所提设定使用弱标注,不同于使用强标签分割掩码的半监督 VOS 设定。该设定评估了在 VOS 设定下泛化至新类别的有效性。该设定将 VOS 数据划分为多个折叠,每折包含不同类别。它提供了一种潜在设定,用于评估少样本对象分割方法如何受益于额外的对象姿态或对象交互——这些在 PASCAL-5i 基准的静态帧中并不可用。
引用
@article{arxiv.1912.08936,
title = {One-Shot Weakly Supervised Video Object Segmentation},
author = {Mennatullah Siam and Naren Doraiswamy and Boris N. Oreshkin and Hengshuai Yao and Martin Jagersand},
journal= {arXiv preprint arXiv:1912.08936},
year = {2019}
}