面向半监督视频实例分割的上下文引导分割框架
计算机视觉与模式识别
2022-04-12 v2
摘要
本文中,我们提出上下文引导分割 (CGS) 框架,以三遍方式用于视频实例分割。在第一遍,即预览分割中,我们提出实例重识别流,通过将每个实例的预览掩码传播到其他帧来估计其主要属性(即人/非人、刚体/可变形、已知/未知类别)。在第二遍,即上下文分割中,我们引入多种上下文分割方案。对于人体实例,我们开发帧内骨架引导分割并结合目标流以跨帧纠正和细化结果。对于非人实例,若其在外观上变化大且属于已知类别(可由初始掩码推断),我们采用实例分割。若非人实例近乎刚体,我们在视频序列首帧的合成图像上训练 FCNs。在最后一遍,即引导分割中,我们在非矩形感兴趣区域 (ROIs) 上开发一种新颖的细粒度分割方法。自然形状 ROI 通过对当前帧邻帧施加引导注意力生成,以减少不同重叠实例分割中的歧义。前向掩码传播之后接后向掩码传播,以进一步恢复因重现实例、快速运动、遮挡或重度变形而缺失的实例片段。最后,基于深度值以及人与非人目标交互和稀有实例优先级合并各帧中的实例。在 DAVIS Test-Challenge 数据集上的实验证明了我们提出框架的有效性。我们在 DAVIS Challenges 2017-2019 中稳定获得第 3 名,全局得分、区域相似度与轮廓精度分别为 75.4%、72.4% 和 78.4%。
引用
@article{arxiv.2106.03330,
title = {Contextual Guided Segmentation Framework for Semi-supervised Video Instance Segmentation},
author = {Trung-Nghia Le and Tam V. Nguyen and Minh-Triet Tran},
journal= {arXiv preprint arXiv:2106.03330},
year = {2022}
}
备注
Project page: https://sites.google.com/view/ltnghia/research/vos