SpatialNet-ViT:如何通过多模态遥感数据集转化�分类
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
遥感数据集为解决诸如土地利用分类、目标存在检测和农村/城市分类等关键分类任务提供了巨大的潜力。然而,许多现有研究倾向于聚焦于狭窄任务或数据集,限制了其在各种遥感分类挑战中实现泛化。为此,我们提出了一种新型模型 SpatialNet-ViT,利用 Vision Transformers(ViTs) 和 Multi-Task Learning(MTL) 的强大功能。这种集成方法结合了空间感知能力与情境理解能力,提高了分类准确率和可扩展性。此外,还采用了数据增强、迁移学习和多任务学习等技术,以增强模型的鲁棒性及其在 diverse 数据集上的泛化能力。
引用
@article{arxiv.2506.22501,
title = {How Can Multimodal Remote Sensing Datasets Transform Classification via SpatialNet-ViT?},
author = {Gautam Siddharth Kashyap and Manaswi Kulahara and Nipun Joshi and Usman Naseem},
journal= {arXiv preprint arXiv:2506.22501},
year = {2025}
}
备注
Accepted in the 2025 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2025), scheduled for 3 - 8 August 2025 in Brisbane, Australia