用于图像分析的地理空间基础模型:评估与增强NASA-IBM Prithvi的领域适应性
计算机视觉与模式识别
2024-09-04 v1 人工智能
摘要
地理空间基础模型(GFMs)的研究因其在实现高泛化性和领域适应性、降低个体研究人员模型训练成本方面的潜力,已成为地理空间人工智能(AI)研究的热门话题。与ChatGPT等大型语言模型不同,构建用于图像分析的视觉基础模型,尤其是在遥感领域,遇到了重大挑战,例如将多样化的视觉任务构建成一个通用的问题框架。本文评估了最近发布的NASA-IBM GFM Prithvi在多个基准数据集上的高级图像分析任务的预测性能。选择Prithvi是因为它是首批在时间序列高分辨率遥感影像上训练的开源GFMs之一。我们设计了一系列实验,以评估Prithvi与其他预训练的任务特定AI模型在地理空间图像分析中的性能比较。我们引入并集成了新的策略,包括波段自适应、多尺度特征生成和微调技术,到一个图像分析流程中,以增强Prithvi的领域适应能力并提高模型性能。深入的分析揭示了Prithvi的优势和劣势,为改进Prithvi和开发未来用于地理空间任务的视觉基础模型提供了见解。
引用
@article{arxiv.2409.00489,
title = {Geospatial foundation models for image analysis: evaluating and enhancing NASA-IBM Prithvi's domain adaptability},
author = {Chia-Yu Hsu and Wenwen Li and Sizhe Wang},
journal= {arXiv preprint arXiv:2409.00489},
year = {2024}
}