中文

动态视频分割网络

计算机视觉与模式识别 2018-06-15 v2

摘要

本文提出了一种用于快速高效语义视频分割的动态视频分割网络(DVSNet)的详细设计。DVSNet由两个卷积神经网络组成:分割网络和流网络。前者生成高精度的语义分割,但网络更深且速度较慢。后者比前者快得多,但其输出需要进一步处理才能生成精度较低的语义分割。我们探索了使用决策网络,基于一种称为期望置信度得分的指标,自适应地将不同帧区域分配给不同的网络。期望置信度得分较高的帧区域通过流网络处理。期望置信度得分较低的帧区域则必须通过分割网络处理。我们在DVSNet的各种配置上进行了大量实验,并研究了所提决策网络的多种变体。实验结果表明,我们的DVSNet在Cityscapes数据集上能够以19.8 fps的速度实现高达70.4%的mIoU。DVSNet的高速版本能够在同一数据集上以30.4 fps提供63.2%的mIoU。DVSNet还能减少高达95%的计算工作负载。

关键词

引用

@article{arxiv.1804.00931,
  title  = {Dynamic Video Segmentation Network},
  author = {Yu-Syuan Xu and Tsu-Jui Fu and Hsuan-Kung Yang and Chun-Yi Lee},
  journal= {arXiv preprint arXiv:1804.00931},
  year   = {2018}
}

备注

CVPR 2018