中文

PP-MobileSeg:探索移动设备上快速准确的语义分割模型

计算机视觉与模式识别 2023-04-12 v1

摘要

Transformer 在计算机视觉中的成功引发了若干将其适配于移动设备的尝试,但在某些真实应用场景中其性能仍不尽如人意。为解决此问题,我们提出 PP-MobileSeg,一种在移动设备上达到最先进性能的语义分割模型。PP-MobileSeg 由三个新颖部分构成:StrideFormer 骨干网络、聚合注意力模块(AAM)和有效插值模块(VIM)。四阶段 StrideFormer 骨干网络由 MV3 块和步幅 SEA 注意力构建,能够以极小参数开销提取丰富的语义与细节特征。AAM 首先通过语义特征集成投票筛选细节特征,再将其与语义特征结合以增强语义信息。此外,我们提出 VIM 将下采样特征上采样至输入图像分辨率。它仅对最终预测中存在的类别进行插值,显著降低了模型延迟,而这是整体模型延迟的最主要来源。大量实验表明,与其他方法相比,PP-MobileSeg 在精度、模型大小和延迟之间实现了更优的权衡。在 ADE20K 数据集上,PP-MobileSeg 的 mIoU 精度比 SeaFormer-Base 高 1.57%,参数少 32.9%,在骁龙 855 上加速快 42.3%。源代码见 https://github.com/PaddlePaddle/PaddleSeg/tree/release/2.8。

关键词

引用

@article{arxiv.2304.05152,
  title  = {PP-MobileSeg: Explore the Fast and Accurate Semantic Segmentation Model on Mobile Devices},
  author = {Shiyu Tang and Ting Sun and Juncai Peng and Guowei Chen and Yuying Hao and Manhui Lin and Zhihong Xiao and Jiangbin You and Yi Liu},
  journal= {arXiv preprint arXiv:2304.05152},
  year   = {2023}
}

备注

8 pages, 3 figures