中文

用于高效视频语义分割的掩码传播方法

计算机视觉与模式识别 2023-10-31 v1 人工智能

摘要

视频语义分割(VSS)旨在为视频序列中每一像素分配语义标签。该领域先前工作通过扩展图像语义分割模型以利用视频帧间时间关系,取得了可喜结果;然而,这些方法常带来显著计算开销。本文提出一种高效的VSS掩码传播框架,称为MPVSS。我们的方法首先在高稀疏关键帧上采用强基于查询的图像分割器,生成准确的二值掩码与类别预测。随后,我们设计一种利用所学查询的光流估计模块,生成一组分割感知光流图,每张图关联关键帧的一个掩码预测。最后,掩码-光流对被扭曲变形,作为非关键帧的掩码预测。通过复用关键帧预测,我们避免了以高开销分割器逐帧处理大量视频帧,缓解了时间冗余并显著降低了计算成本。在VSPW与Cityscapes上的大量实验表明,我们的掩码传播框架实现了SOTA的精度与效率权衡。例如,采用Swin-L骨干的最佳模型在VSPW数据集上以仅26%的FLOPs超越采用MiT-B5的SOTA方法MRCFA达4.0% mIoU。此外,相较逐帧Mask2Former基线,我们的框架在Cityscapes验证集上最多降低4倍FLOPs,且mIoU下降不超过2%。代码见 https://github.com/ziplab/MPVSS。

关键词

引用

@article{arxiv.2310.18954,
  title  = {Mask Propagation for Efficient Video Semantic Segmentation},
  author = {Yuetian Weng and Mingfei Han and Haoyu He and Mingjie Li and Lina Yao and Xiaojun Chang and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2310.18954},
  year   = {2023}
}

备注

NeurIPS 2023