遥感图像土地利用场景分类中的 Vision Transformer 与卷积神经网络
计算机视觉与模式识别
2026-05-21 v1
摘要
从遥感影像进行土地利用场景分类 (LUSC) 在环境监测、城市规划和可持续资源管理中发挥着关键作用。近年来,深度学习方法显著推进了该领域的技术进步,卷积神经网络 (CNN) 因其强大的局部空间特征捕获能力而主导该领域。然而,Vision Transformer (ViT) 的出现引入了新的范式,通过自注意力机制建模长程依赖, potentially 实现更好的全局上下文理解。本文对遥感地表利用场景分类中 Vision Transformer 与 CNN 架构进行比较评估。我们评估了代表性 CNN 模型(如 AlexNet)以及 Vision Transformer (ViT),并使用基准遥感数据集进行实验,包括 UC Merced 土地利用数据集和 EuroSAT 土地利用数据集。该研究 examines 分类准确率、精确率、召回率、F1 分数以及计算复杂度,以提供全面的性能比较。实验结果表明,CNN 在训练样本有限且局部纹理特征突出的数据集上表现稳健,而 Vision Transformer 在训练数据充足时,能够捕获复杂场景中的全局空间关系,表现出优势。然而,ViT 通常需要更大的计算资源和更大的训练数据集才能实现最佳性能。本研究的发现为理解两种架构的优势与局限性提供了见解,并为选择合适的模型用于遥感地表利用场景分类应用提供了指导。
引用
@article{arxiv.2605.21268,
title = {Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification},
author = {Arun D. Kulkarni},
journal= {arXiv preprint arXiv:2605.21268},
year = {2026}
}
备注
12 pages