中文

CtxMIM:面向遥感图像理解的上下文增强掩码图像建模

计算机视觉与模式识别 2024-05-24 v4

摘要

通过在无标签数据上进行自监督学习表征已被证明对理解多样化图像极为有效。然而,遥感图像往往具有复杂且密集的场景,包含多个地物对象且无明显前景对象。这种固有特性导致对象密度高,从而在自监督学习中产生假正样本对或缺失上下文信息。为解决这些问题,我们提出了一种上下文增强的掩码图像建模方法(CtxMIM),一种简单而高效的基于 MIM 的自监督学习方法,用于遥感图像理解。CtxMIM 将原始图像块构建为重建模板,并采用孪生框架对两组图像块进行操作。引入上下文增强生成分支,通过重建中的上下文一致性约束提供上下文信息。凭借简洁优雅的设计,CtxMIM 鼓励预训练模型在大规模数据集上学习对象级或像素级特征,而无需特定的时间或地理约束。最后,大量实验表明,在土地覆盖分类、语义分割、目标检测和实例分割等多种下游任务上,CtxMIM 学习到的特征优于全监督和最先进的自监督学习方法。这些结果表明,CtxMIM 学习到了具有高度泛化性和迁移性的出色遥感表征。代码和数据将公开可用。

关键词

引用

@article{arxiv.2310.00022,
  title  = {CtxMIM: Context-Enhanced Masked Image Modeling for Remote Sensing Image Understanding},
  author = {Mingming Zhang and Qingjie Liu and Yunhong Wang},
  journal= {arXiv preprint arXiv:2310.00022},
  year   = {2024}
}