中文

OVSNet:面向一次性实时视频目标分割

计算机视觉与模式识别 2019-07-03 v2

摘要

视频目标分割旨在跨连续帧准确分割目标物体区域。应对形状形变、遮挡和移出镜头等复杂因素在技术上具有挑战性。近期方法主要通过往返重识别与双向掩码传播在很大程度上解决了这些问题。然而,这些方法极慢且仅支持离线推理,原则上无法应用于实时场景。受此启发,我们提出了一种高效的基于检测的视频目标分割范式。我们提出统一的单次视频分割框架(OVS-Net),以统一流水线建模时空表示,无缝集成目标检测、目标分割与目标重识别。该框架支持一次性推理,可高效且有效地完成视频目标分割。此外,我们提出掩码引导注意力模块,用于建模多尺度物体边界与多级特征融合。在具有挑战性的 DAVIS 2017 上的实验表明,所提框架取得了与当前最优(SOTA)相当的性能,并以约 11.5 FPS 的速度实现了据我们所知的先驱性实时工作,比其他 SOTA 方法快 5 倍以上。

关键词

引用

@article{arxiv.1905.10064,
  title  = {OVSNet : Towards One-Pass Real-Time Video Object Segmentation},
  author = {Peng Sun and Peiwen Lin and Guangliang Cheng and Jianping Shi and Jiawan Zhang and Xi Li},
  journal= {arXiv preprint arXiv:1905.10064},
  year   = {2019}
}

备注

10 pages, 6 figures