中文

基于 Vision Mamba 的混凝土、沥青与砌石表面自主裂缝分割

计算机视觉与模式识别 2024-06-25 v1

摘要

卷积神经网络(CNN)和 Transformer 在特定条件下展示了裂缝检测的先进精度。然而,CNN 的固定局部注意力可能妨碍其泛化能力,Transformer 的全局自注意力的二次复杂度限制了其实际部署。鉴于 Mamba 新一代架构的兴起,本文提出一种基于 Vision Mamba(VMamba)的框架,用于混凝土、沥青和砌石表面的裂缝分割,具有高精度、良好泛化性及较低计算复杂度。该编码器-解码网络的参数数量减少 15.6% - 74.5%,相较于代表性的 CNN 模型可提高最高 2.8% 的 mDS 指数,同时表现约等于 Transformer 模型。此外,基于 VMamba 的编码器-解码网络可处理最高达 90.6% 更低的浮点运算的高分辨率图像输入。

关键词

引用

@article{arxiv.2406.16518,
  title  = {Vision Mamba-based autonomous crack segmentation on concrete, asphalt, and masonry surfaces},
  author = {Zhaohui Chen and Elyas Asadi Shamsabadi and Sheng Jiang and Luming Shen and Daniel Dias-da-Costa},
  journal= {arXiv preprint arXiv:2406.16518},
  year   = {2024}
}

备注

23 pages, 9 figures