中文

使用视觉Transformer的语义分割:综述

计算机视觉与模式识别 2023-05-08 v1 人工智能 机器学习

摘要

语义分割在土地覆盖分析、自动驾驶和医学图像分析等多个领域具有广泛应用。卷积神经网络(CNN)与视觉Transformer(ViT)为语义分割提供了架构模型。尽管ViT在图像分类中已证明成功,但由于其图像块划分方案,ViT并非通用骨干网络,因此不能直接应用于图像分割与物体检测等密集预测任务。在本综述中,我们讨论了若干可用于语义分割的不同ViT架构,以及它们的演进如何应对上述挑战。ViT的兴起及其高成功率的表现促使学界逐步在各类计算机视觉任务中替代传统的卷积神经网络。本综述旨在使用基准数据集回顾并比较为语义分割设计的ViT架构的性能。这将有助于学界了解语义分割中的实现方法,并发现使用ViT的更高效方法。

关键词

引用

@article{arxiv.2305.03273,
  title  = {Semantic Segmentation using Vision Transformers: A survey},
  author = {Hans Thisanke and Chamli Deshan and Kavindu Chamith and Sachith Seneviratne and Rajith Vidanaarachchi and Damayanthi Herath},
  journal= {arXiv preprint arXiv:2305.03273},
  year   = {2023}
}

备注

35 pages, 13 figures, 2 tables