中文

用于侧扫声呐数据语义分割的卷积视觉Transformer

计算机视觉与模式识别 2023-09-08 v1 机器学习

摘要

在从石油钻井平台安装到电缆网络铺设以及监测人类对海洋生态系统影响的广泛海床作业中,区分不同的海洋底栖生境特征至关重要。侧扫声呐(SSS)是这方面广泛使用的成像传感器。它通过记录从海床反射回来的声波强度来生成高分辨率海底地图。在本工作中,我们利用这些声学强度图来对不同海底类型进行像素级分类。我们提出了一种在编码器-解码器框架中改编自Vision Transformer(ViT)的新颖架构。此外,在此过程中,评估了ViT在较小数据集上的适用性。为了克服缺乏类似CNN的归纳偏置,从而使ViT更适用于低数据量的场景,我们提出了一种新颖的特征提取模块来替换Transformer层内的多层感知机(MLP)块,以及一种提取多尺度图像块嵌入的新颖模块。还提出了一种轻量级解码器来补充该设计,以进一步增强多尺度特征提取。通过修改后的架构,我们取得了最先进(state-of-the-art)的结果,并满足了实时计算要求。我们的代码已在~\url{https://github.com/hayatrajani/s3seg-vit} 公开。

关键词

引用

@article{arxiv.2302.12416,
  title  = {A Convolutional Vision Transformer for Semantic Segmentation of Side-Scan Sonar Data},
  author = {Hayat Rajani and Nuno Gracias and Rafael Garcia},
  journal= {arXiv preprint arXiv:2302.12416},
  year   = {2023}
}

备注

Submitted to Ocean Engineering special issue "Autonomous Marine Robotics Operations"