Prithvi-Complimentary Adaptive Fusion Encoder (CAFE):解锁洪水浸积图的全能潜力
摘要
地理基石模型 (GFMs) 在语义分割、分类和回归任务中表现优异,但在使用 Sen1Flood11 数据集进行洪水映射时,GFMs 难以超越基线 U-Net,暴露其在捕捉关键局部细节方面的局限。为此,我们提出 Prithvi-Complementary Adaptive Fusion Encoder (CAFE),将 Prithvi 预训练编码器与由卷积注意力模块 (CAM) 增强的平行 CNN 残差分支集成。Prithvi-CAFE 通过在 Prithvi 中引入适配器,实现快速高效的微调,并进行多尺度、多层级融合,既保留长程依赖,又捕捉关键局部细节。我们在两个综合性洪水映射数据集上实现了最先进的性能:Sen1Flood11 和 FloodPlanet。在 Sen1Flood11 测试数据上,Prithvi-CAFE (IoU 83.41) 分别优于原始 Prithvi (IoU 82.50) 和其他主要 GFMs(TerraMind 82.90、DOFA 81.54、spectralGPT 81.02)。在留置测试站点,Prithvi-CAFE 达到 IoU 81.37,显著优于基线 U-Net (70.57) 和原始 Prithvi (72.42)。在 FloodPlanet 上,Prithvi-CAFE 也超越基线 U-Net 和其他 GFMs,IoU 达到 64.70,分别优于 U-Net (60.14)、Terramind (62.33)、DOFA (59.15) 和 Prithvi 2.0 (61.91)。我们的方法简洁而有效,展示了在多通道、多模态数据提供互补信息且局部细节至关重要的分割任务中,提升性能的强大潜力。代码已发布于 [Prithvi-CAFE Github](https://github.com/Sk-2103/Prithvi-CAFE)。
引用
@article{arxiv.2601.02315,
title = {Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping},
author = {Saurabh Kaushik and Lalit Maurya and Beth Tellman},
journal= {arXiv preprint arXiv:2601.02315},
year = {2026}
}
备注
Accepted at CV4EO Workshop @ WACV 2026