Vision Transformer 与卷积神经网络在遥感图像语义分割中的启发式比较
计算机视觉与模式识别
2025-05-19 v2 人工智能
摘要
Vision Transformer (ViT) 最近在计算机视觉领域带来了新的研究浪潮。这些模型在图像分类和分割方面表现尤为出色。随着新型架构的引入,语义分割和实例分割的研究加速发展,超过 80% 的 iSAID 数据集前 20 名基准基于 ViT 架构或其成功背后的注意力机制。本文聚焦于对三种关键因素进行启发式比较:在 iSAID 数据集上对遥感航空图像进行语义分割时,是否使用 ViT。本研究期间观察到的实验结果基于三个目标进行分析。首先,我们研究了使用加权融合损失函数,以最大化平均交并比 (mIoU) 得分和 Dice 得分,同时最小化熵或类别表示损失。其次,我们将在元公司 (Meta) 的 MaskFormer—a 基于 ViT 的语义分割模型——的迁移学习与基于 mIoU、Dice 得分、训练效率和推理时间的通用 UNet 卷积神经网络 (CNN) 进行比较。最后,我们检验了两种模型与当前最先进分割模型之间的权衡。我们表明,新的组合加权损失函数显著提升了 CNN 模型的性能,而不仅仅是通过 ViT 的迁移学习。本实现的代码可在 https://github.com/ashimdahal/ViT-vs-CNN-Image-Segmentation 查看。
引用
@article{arxiv.2411.09101,
title = {Heuristical Comparison of Vision Transformers Against Convolutional Neural Networks for Semantic Segmentation on Remote Sensing Imagery},
author = {Ashim Dahal and Saydul Akbar Murad and Nick Rahimi},
journal= {arXiv preprint arXiv:2411.09101},
year = {2025}
}