载板卫星图像分类:ViT 模型的比较研究
计算机视觉与模式识别
2025-04-23 v3 信号处理
摘要
本研究聚焦于识别载板卫星处理中最有效的预训练模型,以实现土地利用分类,强调在卫星推理中常见的噪声条件下实现高精度、计算效率和鲁性。通过大量实验,我们比较了传统 CNN 基础、ResNet 基础以及各种预训练视觉 Transformer 模型的性能。我们的发现表明,预训练视觉 Transformer(ViT)模型,特别是 MobileViTV2 和 EfficientViT-M2,在准确率和效率方面均优于从零训练的模型。这些模型在降低计算需求的同时实现了高性能,并在噪声条件下的推理中表现出更大的鲁性。虽然 MobileViTV2 在干净验证数据上表现卓越,但 EfficientViT-M2 在处理噪声时更为鲁性,使其成为载板卫星地球观测任务的最佳模型。我们的实验结果表明,EfficientViT-M2 是可靠且高效的卫星遥感图像分类(RS-IC)的 optimal 选择,实现 98.76% 的准确率、精确率和召回率。具体而言,EfficientViT-M2 在所有指标上均表现最佳,在训练效率(1000s)和推理时间(10s)方面表现出色,并显示出更大的鲁性(总体鲁性得分为 0.79)。因此,EfficientViT-M2 比 MobileViTV2(79.23 W)节省 63.93% 能耗,比 SwinTransformer(108.90 W)节省 73.26% 能耗。这一结果凸显了其在能源效率方面的显著优势。
引用
@article{arxiv.2409.03901,
title = {Onboard Satellite Image Classification for Earth Observation: A Comparative Study of ViT Models},
author = {Thanh-Dung Le and Vu Nguyen Ha and Ti Ti Nguyen and Geoffrey Eappen and Prabhu Thiruvasagam and Hong-fu Chou and Duc-Dung Tran and Hung Nguyen-Kha and Luis M. Garces-Socarras and Jorge L. Gonzalez-Rios and Juan Carlos Merlano-Duncan and Symeon Chatzinotas},
journal= {arXiv preprint arXiv:2409.03901},
year = {2025}
}