中文

通过表示扭曲构建语义视频 CNN

计算机视觉与模式识别 2017-08-11 v1

摘要

在本工作中,我们提出了一种将用于静态图像语义分割的 CNN 模型转换为用于视频数据的 CNN 的技术。我们描述了一种扭曲方法,该方法可用于增强现有架构,且仅需极少的额外计算开销。该模块被称为 NetWarp,我们展示了其在多种网络架构中的应用。主要设计原则是利用相邻帧的光流在时间维度上扭曲内部网络表示。本工作的一个关键洞见是,快速光流方法可以与许多不同的 CNN 架构结合,以提升性能并实现端到端训练。实验验证了当视频流可用时,所提出的方法在提升性能的同时仅产生极少的额外计算开销。我们在 CamVid 和 Cityscapes 基准数据集上取得了新的 state-of-the-art 结果,并展示了对不同基线网络的一致性提升。我们的代码和模型将发布于 http://segmentation.is.tue.mpg.de

关键词

引用

@article{arxiv.1708.03088,
  title  = {Semantic Video CNNs through Representation Warping},
  author = {Raghudeep Gadde and Varun Jampani and Peter V. Gehler},
  journal= {arXiv preprint arXiv:1708.03088},
  year   = {2017}
}

备注

ICCV 2017