SG-Net:用于单阶段视频实例分割的空间粒度网络
计算机视觉与模式识别
2021-04-06 v2
摘要
视频实例分割(VIS)是计算机视觉中一项新颖且关键的任务。迄今为止,性能最优的 VIS 方法通过添加跟踪分支来扩展两阶段 Mask R-CNN,留下了大量改进空间。相反,我们从新视角切入 VIS 任务,并提出一种单阶段空间粒度网络(SG-Net)。与传统的两阶段方法相比,SG-Net 展现出四大优势:1)我们的方法具有单阶段紧凑架构,且各任务头(检测、分割和跟踪)相互依赖地设计,从而能有效共享特征并受益于联合优化;2)我们的掩码预测在每个检测实例的子区域上动态进行,生成细粒度的优质掩码;3)我们的各项任务预测均避免使用昂贵的基于提议的 RoI 特征,从而大幅降低每个实例的运行复杂度;4)我们的跟踪头对物体中心度运动进行建模以实现跟踪,有效增强了对不同物体外观的跟踪鲁棒性。在评估中,我们在 YouTube-VIS 数据集上展示了最先进的对比结果。大量实验表明,我们紧凑的单阶段方法在准确率和推理速度上均能取得更优性能。我们希望 SG-Net 能作为 VIS 任务的一个强大且灵活的基线。我们的代码将公开。
引用
@article{arxiv.2103.10284,
title = {SG-Net: Spatial Granularity Network for One-Stage Video Instance Segmentation},
author = {Dongfang Liu and Yiming Cui and Wenbo Tan and Yingjie Chen},
journal= {arXiv preprint arXiv:2103.10284},
year = {2021}
}
备注
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2021)