DFANet:面向实时语义分割的深度特征聚合网络
计算机视觉与模式识别
2019-04-05 v1
摘要
本文提出了一种名为 DFANet 的极高效率 CNN 架构,用于在资源受限条件下进行语义分割。我们提出的网络从单一轻量骨干网络出发,分别通过子网络与子阶段级联来聚合判别性特征。基于多尺度特征传播,DFANet 大幅减少了参数数量,同时仍获得充足的感受野并增强了模型学习能力,从而在速度与分割性能之间取得平衡。在 Cityscapes 和 CamVid 数据集上的实验表明,DFANet 相较于现有最先进(state-of-the-art)的实时语义分割方法,以 8 倍更少的 FLOPs 和 2 倍更快的速度取得了优越性能,且精度相当。具体而言,在单张 NVIDIA Titan X 显卡上,其在 Cityscapes 测试数据集上以仅 1.7 GFLOPs 和 160 FPS 的速度达到 70.3% 平均交并比(Mean IOU),而在更高分辨率图像推理时以 3.4 GFLOPs 达到 71.3% 平均交并比。
引用
@article{arxiv.1904.02216,
title = {DFANet: Deep Feature Aggregation for Real-Time Semantic Segmentation},
author = {Hanchao Li and Pengfei Xiong and Haoqiang Fan and Jian Sun},
journal= {arXiv preprint arXiv:1904.02216},
year = {2019}
}