一种用于遥感图像语义分割深度学习网络的通用预训练策略
计算机视觉与模式识别
2026-05-01 v1
摘要
在遥感图像分割中,深度学习模型通常先使用ImageNet等大型图像数据库进行预训练,再在特定领域的数据集上进行微调。然而,这些微调模型的性能常因ImageNet图像与待处理遥感图像之间巨大的领域差异(即场景和模态差异)而受限。因此,许多研究者致力于构建大规模领域特定图像数据集用于预训练,以期提升模型性能。然而,构建此类数据集通常颇具挑战,需要付出巨大努力,且这些数据集往往对其他应用场景的泛化能力有限。为解决这些问题,本研究引入了一种新颖而简单的预训练策略,旨在引导模型在预训练期间避免学习预训练数据集中的领域特定特征,从而提高预训练模型的泛化能力。为评估该策略的有效性,深度学习模型在ImageNet上进行预训练,随后在四个具有不同场景和模态的语义分割数据集(包括iSAID、MFNet、PST900和Potsdam)上进行微调。实验结果表明,所提出的预训练策略在所有四个数据集上均达到了最先进的精度,即iSAID的mIoU为67.4%,MFNet的mIoU为56.9%,PST900的mIoU为84.22%,Potsdam的mF1为91.88%。本研究为开发适用于计算机视觉和遥感应用的统一基础模型奠定了基础。
引用
@article{arxiv.2604.27704,
title = {A generalised pre-training strategy for deep learning networks in semantic segmentation of remotely sensed images},
author = {Yuan Fang and Yuanzhi Cai and Jagannath Aryal and Qinfeng Zhu and Hong Huang and Cheng Zhang and Lei Fan},
journal= {arXiv preprint arXiv:2604.27704},
year = {2026}
}