重新思考膨胀卷积用于实时语义分割
计算机视觉与模式识别
2023-11-29 v3 图像与视频处理
摘要
感受野是设计语义分割模型时的一项重要指标。为获得大感受野,以往方法通常选择快速下采样分辨率,一般采用平均池化或步长为 2 的卷积。我们采用不同方法:在主干网络中全程使用大膨胀率的膨胀卷积,使主干能通过调整膨胀率轻松调节感受野,并表明其与现有方法具有竞争力。为有效使用膨胀卷积,我们给出了膨胀率的一个简单上界以避免卷积权重间出现空隙,并设计了受 SE-ResNeXt 启发的块结构,使用两个具有不同膨胀率的并行 卷积来保留局部细节。手动调节每个块的膨胀率可能困难,因此我们还引入一种可微神经架构搜索方法,利用梯度下降优化膨胀率。此外,我们提出一种轻量解码器,比常见替代方案更好地恢复局部信息。为证明方法有效性,我们的模型 RegSeg 在实时 Cityscapes 与 CamVid 数据集上取得具竞争力结果。使用 T4 GPU 与混合精度,RegSeg 在 Cityscapes 测试集以 FPS 取得 78.3 mIOU,在 CamVid 测试集以 FPS 取得 80.9 mIOU,两者均未使用 ImageNet 预训练。
引用
@article{arxiv.2111.09957,
title = {Rethinking Dilated Convolution for Real-time Semantic Segmentation},
author = {Roland Gao},
journal= {arXiv preprint arXiv:2111.09957},
year = {2023}
}
备注
CVPR 2023 Efficient CV workshop