NeighborMAE: 在遮蔽自编码器预训练中利用相邻地球观测图像的空间依赖关系
计算机视觉与模式识别
2026-03-04 v1
摘要
遮蔽图像建模是从大规模无标签地球观测图像中学习表征的最流行的自监督学习范式之一。虽然在遮蔽图像建模中融合多模态和多时序地球观测数据已被广泛探索,但邻近区域捕获的图像之间的空间依赖关系仍基本被忽略。由于地球表面是连续的,邻近图像高度相关并提供丰富的上下文信息,可用于自监督学习。为弥合这一差距,我们提出了 NeighborMAE,通过联合重建相邻地球观测图像来学习空间依赖关系。为确保重建保持具有挑战性,我们利用一种启发式策略动态调整遮蔽比率和像素级损失权重。实验结果表明,NeighborMAE 在各种预训练数据集和下游任务上均显著优于现有基准方法,凸显了相邻图像在遥感图像遮蔽建模中的价值以及我们设计的有效性。
引用
@article{arxiv.2603.02522,
title = {NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining},
author = {Liang Zeng and Valerio Marsocci and Wufan Zhao and Andrea Nascetti and Maarten Vergauwen},
journal= {arXiv preprint arXiv:2603.02522},
year = {2026}
}