中文

遥感地球观测数据的深度多模态融合语义分割

计算机视觉与模式识别 2024-10-02 v1

摘要

精确的遥感影像语义分割对于土地覆盖制图、城市规划和环境监测等地球观测应用至关重要。然而,单个数据源常常为此任务提供局限。非常高分辨率 (VHR) 空中图像提供丰富的空间细节,但无法捕捉土地覆盖变化的时间信息。相反,卫星图像时间序列 (SITS) 捕捉了如植被季节性变化等时空动态,但空间分辨率有限,难以区分细小尺度目标。本文提出一种晚期融合深度学习模型 (LF-DLM) 用于语义分割,利用 VHR 空中图像和 SITS 的互补优势。该模型由两个独立的深度学习分支构成:一个分支将来自空中图像的纹理细节与多轴视觉变换器 (MaxViT) 主干集成在一起;另一个分支则使用带时间注意力编码器 (U-TAE) 的 U-Net 从 Sentinel-2 卫星图像时间序列中捕获复杂的时空动态。该方法在 FLAIR 数据集上实现了最先进的结果,该数据集是大规模用于多源光学影像土地覆盖分割的基准数据集。研究结果突显了在遥感应用中采用多模态融合以提高语义分割准确性和鲁棒性的重要性。

关键词

引用

@article{arxiv.2410.00469,
  title  = {Deep Multimodal Fusion for Semantic Segmentation of Remote Sensing Earth Observation Data},
  author = {Ivica Dimitrovski and Vlatko Spasev and Ivan Kitanovski},
  journal= {arXiv preprint arXiv:2410.00469},
  year   = {2024}
}