中文

语义流用于快速准确的场景解析

计算机视觉与模式识别 2021-03-30 v3 机器人学

摘要

在本文中,我们专注于设计用于快速准确场景解析的有效方法。提高性能的常见做法是获得具有高分辨率且具有强语义表示的特征图。两种广泛使用的策略——空洞卷积和特征金字塔融合——要么计算密集,要么效果不佳。受用于相邻视频帧间运动对齐的光流启发,我们提出了一种流对齐模块(FAM),以学习相邻层级特征图之间的语义流,并有效且高效地将高层特征广播到高分辨率特征。此外,将我们的模块集成到常见的特征金字塔结构中,即使在轻量级骨干网络(如 ResNet-18)上也表现出优于其他实时方法的性能。我们在多个具有挑战性的数据集上进行了大量实验,包括 Cityscapes、PASCAL Context、ADE20K 和 CamVid。特别是,我们的网络首次以 26 FPS 的帧率在城市景观数据集上达到 80.4% mIoU。代码可在 \url{https://github.com/lxtGH/SFSegNets} 获取。

关键词

引用

@article{arxiv.2002.10120,
  title  = {Semantic Flow for Fast and Accurate Scene Parsing},
  author = {Xiangtai Li and Ansheng You and Zhen Zhu and Houlong Zhao and Maoke Yang and Kuiyuan Yang and Yunhai Tong},
  journal= {arXiv preprint arXiv:2002.10120},
  year   = {2021}
}

备注

accepted by ECCV 2020(oral)