中文

用于实时语义分割的空间辅助编解码网络

计算机视觉与模式识别 2023-09-20 v1

摘要

语义分割是自动驾驶汽车理解周围环境的一项关键技术。当前,实时语义分割网络通常采用编解码架构或双通路架构。一般而言,编解码模型往往更快,而双通路模型表现出更高精度。为兼顾两者优势,我们提出空间辅助编解码网络(SANet)以融合两种架构。在整体架构中,我们保持编解码设计,同时在编码器中间部分保留特征图,并利用空洞卷积分支进行同分辨率特征提取。在编码器末端,我们集成非对称池化金字塔池化模块(APPPM)以优化特征图的语义提取。该模块结合非对称池化层以多分辨率提取特征。在解码器中,我们提出混合注意力模块 SAD,融合水平与垂直注意力以促进各分支的组合。为验证方法有效性,我们的 SANet 模型在实时 CamVid 与 Cityscape 数据集上取得具竞争力的结果。使用单张 2080Ti GPU,SANet 在 Cityscape 测试集上以 65.1 FPS 取得 78.4% mIOU,在 CamVid 测试集上以 147 FPS 取得 78.8% mIOU。SANet 的训练代码与模型见于 https://github.com/CuZaoo/SANet-main。

关键词

引用

@article{arxiv.2309.10519,
  title  = {Spatial-Assistant Encoder-Decoder Network for Real Time Semantic Segmentation},
  author = {Yalun Wang and Shidong Chen and Huicong Bian and Weixiao Li and Qin Lu},
  journal= {arXiv preprint arXiv:2309.10519},
  year   = {2023}
}