重新审视用于语义分割的多尺度特征融合
计算机视觉与模式识别
2022-06-16 v2 人工智能
摘要
人们通常认为,高内部分辨率结合昂贵操作(如空洞卷积)是精确语义分割所必需的,但这会导致速度慢且内存占用大。在本文中,我们质疑这一看法,并证明高内部分辨率和空洞卷积均非必要。我们的直觉是:尽管分割是一项密集的逐像素预测任务,但每个像素的语义往往同时依赖于邻近邻域和远距离上下文;因此,一个更强大的多尺度特征融合网络起着关键作用。遵循这一直觉,我们重新审视了传统的多尺度特征空间(通常止于 P5)并将其扩展至丰富得多的空间,直至 P9,其中最小特征仅为输入尺寸的 1/512,从而具有非常大的感受野。为处理如此丰富的特征空间,我们利用近期的 BiFPN 来融合多尺度特征。基于这些见解,我们开发了一个简化的分割模型,名为 ESeg,它既没有高内部分辨率,也没有昂贵的空洞卷积。或许令人惊讶的是,我们的简单方法在多个数据集上能以比先前方法更快的速度取得更好的精度。在实时设定下,ESeg-Lite-S 在 CityScapes [12] 上以 189 FPS 取得 76.0% mIoU,优于 FasterSeg [9](73.1% mIoU,170 FPS)。我们的 ESeg-Lite-L 以 79 FPS 运行并取得 80.1% mIoU,大幅缩小了实时与高性能分割模型之间的差距。
引用
@article{arxiv.2203.12683,
title = {Revisiting Multi-Scale Feature Fusion for Semantic Segmentation},
author = {Tianjian Meng and Golnaz Ghiasi and Reza Mahjourian and Quoc V. Le and Mingxing Tan},
journal= {arXiv preprint arXiv:2203.12683},
year = {2022}
}