中文

MultiMAE与地球观测融合:为地球观测任务预训练多模态多任务掩码自编码器

计算机视觉与模式识别 2025-05-22 v1

摘要

地球观测(EO)中的多模态数据为改进深度学习模型的迁移学习能力提供了巨大机遇。不同于先前工作常忽视EO多模态数据的做法,最近的方法开始包括它, resulting in more effective pre-training strategies。然而,现有方法常面临在下游任务中有效迁移学习的挑战,因为这些任务中可用数据的结构不同于预训练期间使用的结构。本文通过探索更灵活的多模态、多任务预训练策略来克服这一限制。具体而言,我们采用多模态多任务掩码自编码器(MultiMAE),通过重建包括光谱、地形和分割数据等多种输入模态来进行预训练。预训练的模型在各种EO数据集上进行分类和分割任务,显示出优于最先进方法的强大迁移学习能力。我们的方法具有显著的灵活性,能够在不要求特定模态的预训练模型的情况下处理多样化的输入配置。代码将在:https://github.com/josesosajs/multimae-meets-eo 上提供。

关键词

引用

@article{arxiv.2505.14951,
  title  = {MultiMAE Meets Earth Observation: Pre-training Multi-modal Multi-task Masked Autoencoders for Earth Observation Tasks},
  author = {Jose Sosa and Danila Rukhovich and Anis Kacem and Djamila Aouada},
  journal= {arXiv preprint arXiv:2505.14951},
  year   = {2025}
}