用于道路场景实时精确语义分割的深度双分辨率网络
计算机视觉与模式识别
2024-10-28 v2
摘要
语义分割是自动驾驶车辆理解周围场景的一项关键技术。当代模型引人注目的性能通常以沉重计算和冗长推理时间为代价,这对自动驾驶而言难以承受。使用轻量架构(编码器-解码器或双通路)或在低分辨率图像上推理,近期方法实现了非常快速的场景解析,甚至在单块 1080Ti GPU 上以超过 100 FPS 运行。然而,这些实时方法与基于膨胀骨干网的模型之间在性能上仍存在显著差距。为解决这个问题,我们提出了一系列专为实时语义分割设计的高效骨干网。所提出的深度双分辨率网络(DDRNets)由两个深度分支组成,其间执行多次双边融合。此外,我们设计了一种名为深度聚合金字塔池化模块(DAPPM)的新上下文信息提取器,以基于低分辨率特征图扩大有效感受野并融合多尺度上下文。我们的方法在 Cityscapes 和 CamVid 数据集上均实现了精度与速度间新的最先进权衡。特别是在单块 2080Ti GPU 上,DDRNet-23-slim 在 Cityscapes 测试集上以 102 FPS 取得 77.4% mIoU,在 CamVid 测试集上以 230 FPS 取得 74.7% mIoU。借助广泛使用的测试增强,我们的方法优于大多数最先进模型且所需计算量少得多。代码与训练模型已在线提供。
引用
@article{arxiv.2101.06085,
title = {Deep Dual-resolution Networks for Real-time and Accurate Semantic Segmentation of Road Scenes},
author = {Yuanduo Hong and Huihui Pan and Weichao Sun and Yisong Jia},
journal= {arXiv preprint arXiv:2101.06085},
year = {2024}
}
备注
12 pages, 7 figures. This work has been submitted to the IEEE for possible publication