中文

基于多流CNN的视频语义分割用于自动驾驶

计算机视觉与模式识别 2019-03-25 v1 机器学习 机器学习

摘要

大多数语义分割算法即使在视频情况下也基于单帧操作。本工作中,目标是在算法模型内利用时间信息以借助运动线索与时间一致性。我们提出两种基于循环全卷积网络(RFCN)与多流全卷积网络(MSFCN)的简单高层架构。对于RFCN,在编码器与解码器间插入名为LSTM的循环网络。MSFCN通过1x1通道卷积将不同帧的编码器组合为融合编码器。我们使用ResNet50网络作为基线编码器并构建三个网络,即2阶与3阶MSFCN以及2阶RFCN。MSFCN-3在SYNTHIA-CVPR'16数据集上使用平均交并比(mean IoU)度量,对高速公路与类纽约城市场景分别取得9%和15%的精度提升。MSFCN-3在SegTrack V2与DAVIS数据集上相较基线FCN网络也分别取得11%和6%的提升。我们还设计了MSFCN-2与RFCN-2的高效版本,通过在两个编码器间共享权重。高效MSFCN-2相较基线版本在KITTI与SYNTHIA上分别提供11%和5%的提升,且计算复杂度增加可忽略。

关键词

引用

@article{arxiv.1901.02511,
  title  = {Multi-stream CNN based Video Semantic Segmentation for Automated Driving},
  author = {Ganesh Sistu and Sumanth Chennupati and Senthil Yogamani},
  journal= {arXiv preprint arXiv:1901.02511},
  year   = {2019}
}

备注

Accepted for Oral Presentation at VISAPP 2019