中文

基于标签传播与精炼的高效视频语义分割

计算机视觉与模式识别 2019-12-30 v1

摘要

本文采用 GPU/CPU 混合方法解决高清晰度视频的实时语义分割问题。我们提出一种高效视频分割(EVS)流水线,其结合:(i)在 CPU 上,一种极快的光流方法,用于利用视频的时间特性并将语义信息从一帧传播至下一帧,其与 GPU 并行运行。(ii)在 GPU 上,两个卷积神经网络:一个用于从零预测密集语义标签的主分割网络,以及一个借助快速不一致注意力模块(IAM)改进先前帧预测的精炼网络。后者可识别无法准确传播的区域。我们依据期望帧率与精度给出了若干工作点。我们的流水线达到了与现有实时语义图像分割方法竞争的精度水平(mIoU 高于 60%),同时实现了高得多的帧率。在具有高分率帧(2048 x 1024)的流行 Cityscapes 数据集上,所提工作点在单 GPU 与 CPU 上涵盖 80 至 1000 Hz。

关键词

引用

@article{arxiv.1912.11844,
  title  = {Efficient Video Semantic Segmentation with Labels Propagation and Refinement},
  author = {Matthieu Paul and Christoph Mayer and Luc Van Gool and Radu Timofte},
  journal= {arXiv preprint arXiv:1912.11844},
  year   = {2019}
}

备注

Accepted at WACV2020