中文

通过因子化金字塔学习实现高效上下文融合的超低功耗语义分割

计算机视觉与模式识别 2023-02-24 v1

摘要

语义分割是一项对输入图像逐像素进行分类的像素级预测任务。卷积神经网络(CNNs)等深度学习模型在该领域取得了极为优异的性能。然而,自动驾驶等移动应用需要对连续图像流进行实时处理。因此,在保持高精度的同时实现高效架构至关重要。由于 CNNs 的精度与模型大小本质上相互制约,挑战在于取得精度与模型大小之间的良好权衡。为此,我们提出一种新颖的因子化金字塔学习(FPL)模块,以高效方式聚合丰富的上下文信息。一方面,它使用一组具有多种膨胀率的卷积滤波器,实现多尺度上下文聚合;这对提升精度至关重要。另一方面,通过对所用滤波器进行精细因子化来减少参数量;这对实现轻量模型至关重要。此外,我们将空间金字塔分解为两个阶段,从而在模块内实现简单高效的特融合,以解决严重的棋盘效应。我们还设计了一个专用的特征-图像增强(FIR)单元,将浅层与深层特征同输入图像的下采样版本进行融合。这在不增加模型参数的情况下提升了精度。基于 FPL 模块与 FIR 单元,我们提出了一种名为 FPLNet 的超低功耗实时网络,取得了最先进的精度-效率权衡。更具体地,所提网络仅用不到 50 万参数,即在 Cityscapes 验证集与测试集上分别取得 66.93% 与 66.28% 的 mIoU。此外,FPLNet 的处理速度为 95.5 帧每秒(FPS)。

关键词

引用

@article{arxiv.2302.11785,
  title  = {Efficient Context Integration through Factorized Pyramidal Learning for Ultra-Lightweight Semantic Segmentation},
  author = {Nadeem Atif and Saquib Mazhar and Debajit Sarma and M. K. Bhuyan and Shaik Rafi Ahamed},
  journal= {arXiv preprint arXiv:2302.11785},
  year   = {2023}
}