中文

卷积神经网络 vs 视觉 Transformer:SpaceNet 案例研究——平衡 vs 不平衡 条件

计算机视觉与模式识别 2025-10-07 v1 人工智能 机器学习

摘要

我们对比了卷积神经网络 (EfficientNet-B0) 和视觉 Transformer (ViT-Base) 在 SpaceNet 上的两个标签分布情景下的表现:一种是自然的五分类不平衡划分,另一种是平衡抽样后的划分(每个类别 700 张图像,70:20:10 train/val/test)。在匹配的预处理 (224x224,ImageNet 归一化)、轻量数据增强和 40 个 epoch 的预算(单张 NVIDIA P100)下,我们报告准确率、宏 F1、平衡准确率、每个类别的召回率以及部署指标 (模型大小和延迟)。在不平衡划分上,EfficientNet-B0 达到 93% 测试准确率,表现出强劲的宏 F1 和较低的延迟;ViT-Base 在准确率达到 93% 时参数更大、运行更慢。在平衡划分上,两者表现均佳;EfficientNet-B0 达到 99%,而 ViT-Base 仍具竞争力,表明平衡化缩小了架构差距,而 CNN 仍保留效率优势。我们发布了 manifest、日志和逐图像预测,以支持可重复性。

关键词

引用

@article{arxiv.2510.03297,
  title  = {Convolutional Neural Nets vs Vision Transformers: A SpaceNet Case Study with Balanced vs Imbalanced Regimes},
  author = {Akshar Gothi},
  journal= {arXiv preprint arXiv:2510.03297},
  year   = {2025}
}

备注

5 pages, 1 figure, 9 tables. Code and artifacts: https://github.com/akshar27/spacenet-cnn-vs-vit (release v1.0.1)