用于语义分割的简洁高效架构
计算机视觉与模式识别
2022-06-17 v1 机器学习
图像与视频处理
摘要
尽管用于语义分割的 SOTA 架构(如 HRNet)展现出令人印象深刻的精度,但其显著设计选择所带来的复杂性阻碍了多种模型加速工具的应用,并且它们还使用了在当前硬件上效率低下的操作。本文表明,带有类 ResNet 骨干网络与小型多尺度头的简单编码器-解码器架构,性能可与 HRNet、FANet 和 DDRNets 等复杂语义分割架构持平甚至更优。由于这些为图像分类设计的深层骨干网络的有效感受野要小得多,将其直接应用于语义分割任务会导致欠佳的结果。HRNet、DDRNet 和 FANet 等工作中提出的各种设计选择隐含地构建了具有较大有效感受野的网络。自然会问:若由具有更大有效感受野的骨干网络构成,且不使用空洞卷积等低效操作,简单编码器-解码器架构是否能取得有利对比。我们展示,通过对 ResNet 进行微小且廉价的修改以扩大感受野,可为语义分割创建非常简单且具有竞争力的基线。我们提出了面向桌面与移动端目标的一系列此类简单架构,其在 Cityscapes 数据集上的性能匹配或超越了复杂模型。我们希望本工作为从业者开发高效语义分割模型提供简洁而有效的基线。
引用
@article{arxiv.2206.08236,
title = {Simple and Efficient Architectures for Semantic Segmentation},
author = {Dushyant Mehta and Andrii Skliar and Haitam Ben Yahia and Shubhankar Borse and Fatih Porikli and Amirhossein Habibian and Tijmen Blankevoort},
journal= {arXiv preprint arXiv:2206.08236},
year = {2022}
}
备注
To be presented at Efficient Deep Learning for Computer Vision Workshop at CVPR 2022