基于时间掩码一致性的视频弱监督实例分割
计算机视觉与模式识别
2021-03-25 v1
摘要
弱监督实例分割降低了训练模型所需的标注成本。然而,现有仅依赖图像级类别标签的方法主要因以下原因产生误差:(a) 物体分割不完整;(b) 物体预测缺失。我们表明,通过改用弱标注视频而非图像进行训练,可以更好地解决这些问题。在视频中,运动以及跨帧预测的时间一致性提供了互补信号,有助于分割。我们首次探索利用这些视频信号来解决弱监督实例分割问题。我们提出了两种在模型中利用该信息的方法。首先,我们调整像素间关系网络(IRN),以在训练过程中有效融入运动信息。其次,我们引入一个新的 MaskConsist 模块,通过在训练期间在相邻帧之间传递稳定预测,解决物体实例缺失的问题。我们证明,这两种方法共同将 Youtube-VIS 和 Cityscapes 两个数据集视频帧上的实例分割指标 分别提升了 和 。
引用
@article{arxiv.2103.12886,
title = {Weakly Supervised Instance Segmentation for Videos with Temporal Mask Consistency},
author = {Qing Liu and Vignesh Ramanathan and Dhruv Mahajan and Alan Yuille and Zhenheng Yang},
journal= {arXiv preprint arXiv:2103.12886},
year = {2021}
}
备注
14 pages, 8 figures, accepted by CVPR 2021