基于遮挡块预测与标记的自监督视频对象分割
计算机视觉与模式识别
2022-04-25 v1 图像与视频处理
摘要
我们提出了一种新颖的自监督视频对象分割(VOS)方法,力求实现更好的对象-背景可判别性以进行准确的目标分割。与以往的自监督 VOS 方法不同,我们的方法基于一种判别性学习损失公式,该公式同时考虑对象和背景信息以确保对象-背景可判别性,而非仅使用对象外观。该判别性学习损失由基于遮挡块的重建(遮挡块表示一帧中的部分区域,其像素被替换为某些常数值)和标记预测损失项组成。基于遮挡块的重建项利用简单的遮挡方案来学习当前帧与先前帧之间的逐像素对应关系,从而重建带有添加遮挡区域的原始当前帧。所引入的遮挡块引导模型既关注感兴趣对象的重要特征,也关注其较不重要的特征,从而隐式地使模型具备处理基于遮挡场景的能力。接下来,标记预测项通过对遮挡区域内所有相似像素的标记进行分组,同时将其与重建帧其余像素的标记分离,来促进对象-背景的可分离性。此外,我们引入了一种放大方案,通过捕捉多尺度精细结构信息来解决小对象分割问题。我们提出的方法称为 CT-VOS,在两个具有挑战性的基准 DAVIS-2017 和 Youtube-VOS 上取得了最先进的结果。详细的消融实验展示了所提损失公式对有效捕捉对象-背景可判别性的重要性,以及我们的放大方案对准确分割小型对象的影响。
引用
@article{arxiv.2204.10846,
title = {Self-Supervised Video Object Segmentation via Cutout Prediction and Tagging},
author = {Jyoti Kini and Fahad Shahbaz Khan and Salman Khan and Mubarak Shah},
journal= {arXiv preprint arXiv:2204.10846},
year = {2022}
}