用于高效单阶段视频实例分割的空间特征校准与时间融合
计算机视觉与模式识别
2021-04-13 v1 图像与视频处理
摘要
现代单阶段视频实例分割网络存在两个局限。首先,卷积特征既未与锚框对齐,也未与真实边界框对齐,降低了掩码对空间位置的敏感性。其次,视频被直接划分为单独帧进行帧级实例分割,忽略了相邻帧之间的时间相关性。为解决这些问题,我们提出了一种通过空间校准与时间融合实现的简单而有效的单阶段视频实例分割框架,即 STMask。为确保与真实边界框的空间特征校准,我们首先在真实边界框周围预测回归边界框,并从中提取特征用于帧级实例分割。为进一步探索视频帧间的时间相关性,我们聚合了一个时间融合模块,将实例掩码从每帧推断至其相邻帧,这有助于我们的框架处理诸如运动模糊、部分遮挡和非常规物体到相机姿态等具有挑战性的视频。在 YouTube-VIS 验证集上的实验表明,所提出的带有 ResNet-50/-101 骨干的 STMask 获得了 33.5% / 36.8% 的掩码 AP,同时在视频实例分割上达到 28.6 / 23.4 FPS。代码已在线发布于 https://github.com/MinghanLi/STMask。
引用
@article{arxiv.2104.05606,
title = {Spatial Feature Calibration and Temporal Fusion for Effective One-stage Video Instance Segmentation},
author = {Minghan Li and Shuai Li and Lida Li and Lei Zhang},
journal= {arXiv preprint arXiv:2104.05606},
year = {2021}
}