中文

结合高效 Transformer 与 CNN 的轻量级实时语义分割网络

计算机视觉与模式识别 2023-02-22 v1

摘要

在过去十年中,卷积神经网络(CNNs)在语义分割方面表现出色。尽管 CNN 模型性能令人印象深刻,但其捕捉全局表征的能力仍显不足,导致结果次优。近来,Transformer 在 NLP 任务中取得巨大成功,展现出建模长程依赖的优势。最近,Transformer 也引起了计算机视觉研究者的极大关注,他们将图像处理任务重构为序列到序列预测,却导致局部特征细节退化。本工作中,我们提出一种名为 LETNet 的轻量级实时语义分割网络。LETNet 以胶囊嵌入方式有效结合 U 形 CNN 与 Transformer,以弥补各自缺陷。同时,精心设计的轻量级空洞瓶颈(LDB)模块与特征增强(FE)模块从零训练时同步产生积极影响。在具有挑战性的数据集上进行的大量实验表明,LETNet 在精度与效率平衡上取得优越性能。具体而言,在单块 RTX 3090 GPU 上,其仅含 0.95M 参数与 13.6G FLOPs,却在 Cityscapes 测试集以 120 FPS 取得 72.8% mIoU,在 CamVid 测试数据集以 250 FPS 取得 70.5% mIoU。源代码将发布于 https://github.com/IVIPLab/LETNet。

关键词

引用

@article{arxiv.2302.10484,
  title  = {Lightweight Real-time Semantic Segmentation Network with Efficient Transformer and CNN},
  author = {Guoan Xu and Juncheng Li and Guangwei Gao and Huimin Lu and Jian Yang and Dong Yue},
  journal= {arXiv preprint arXiv:2302.10484},
  year   = {2023}
}

备注

IEEE Transactions on Intelligent Transportation Systems, 10 pages