面向街景实时语义分割的阶段感知特征对齐网络
计算机视觉与模式识别
2022-03-09 v1
摘要
过去几年中,基于深度卷积神经网络的方法在街景语义分割方面取得了很大进展。一些近期方法通过对齐特征图来缓解它们之间的语义鸿沟,并实现了较高的分割精度。然而,它们通常在解码器中采用具有相同网络配置的特征对齐模块,从而忽略了解码器各阶段在特征聚合过程中的不同作用,导致解码器结构复杂。这种方式极大影响了推理速度。本文提出一种基于编码器-解码器结构的新型阶段感知特征对齐网络(SFANet),用于街景实时语义分割。具体而言,提出阶段感知特征对齐模块(SFA)以有效对齐和聚合相邻两层特征图。在SFA中,考虑到解码器中每个阶段的独特作用,设计了新型阶段感知特征增强块(FEB)以增强来自编码器的特征图的空间细节与上下文信息。以此方式,我们得以用非常简单高效的多分支解码器结构解决错位问题。此外,开发了一种辅助训练策略,在推理阶段不带来额外计算成本的情况下显式缓解多尺度目标问题。实验结果表明,所提SFANet在街景实时语义分割的精度与速度间取得了良好平衡。特别地,基于ResNet-18,SFANet在仅使用单块GTX 1080Ti GPU的情况下,在具有挑战性的Cityscapes和CamVid测试数据集上分别以37 FPS和96 FPS的推理速度取得了78.1%和74.7%的类别平均交并比(mIoU)。
引用
@article{arxiv.2203.04031,
title = {Stage-Aware Feature Alignment Network for Real-Time Semantic Segmentation of Street Scenes},
author = {Xi Weng and Yan Yan and Si Chen and Jing-Hao Xue and Hanzi Wang},
journal= {arXiv preprint arXiv:2203.04031},
year = {2022}
}