动态视频分割网络
计算机视觉与模式识别
2018-06-15 v2
摘要
本文提出了一种用于快速高效语义视频分割的动态视频分割网络(DVSNet)的详细设计。DVSNet由两个卷积神经网络组成:分割网络和流网络。前者生成高精度的语义分割,但网络更深且速度较慢。后者比前者快得多,但其输出需要进一步处理才能生成精度较低的语义分割。我们探索了使用决策网络,基于一种称为期望置信度得分的指标,自适应地将不同帧区域分配给不同的网络。期望置信度得分较高的帧区域通过流网络处理。期望置信度得分较低的帧区域则必须通过分割网络处理。我们在DVSNet的各种配置上进行了大量实验,并研究了所提决策网络的多种变体。实验结果表明,我们的DVSNet在Cityscapes数据集上能够以19.8 fps的速度实现高达70.4%的mIoU。DVSNet的高速版本能够在同一数据集上以30.4 fps提供63.2%的mIoU。DVSNet还能减少高达95%的计算工作负载。
引用
@article{arxiv.1804.00931,
title = {Dynamic Video Segmentation Network},
author = {Yu-Syuan Xu and Tsu-Jui Fu and Hsuan-Kung Yang and Chun-Yi Lee},
journal= {arXiv preprint arXiv:1804.00931},
year = {2018}
}
备注
CVPR 2018