中文

用于 SAR-光学联合表征自监督学习的视觉 Transformer

计算机视觉与模式识别 2022-06-15 v4

摘要

自监督学习(SSL)因能在无需人工标注的情况下学习任务无关的表征,而在遥感和地球观测中引起了极大兴趣。虽然遥感中大多数现有的 SSL 工作利用 ConvNet 骨干网络并聚焦于单一模态,我们探索了视觉 Transformer(ViT)在 SAR-光学联合表征学习中的潜力。基于 DINO(一种从输入图像的两个增强视图中蒸馏知识的最先进 SSL 算法),我们通过将所有通道拼接为统一输入来组合 SAR 与光学影像。随后,我们随机掩码掉某一模态的通道作为一种数据增强策略。在训练时,模型被输入仅光学、仅 SAR 以及 SAR-光学图像对,从而学习模态内与模态间的表征。采用 BigEarthNet-MM 数据集的实验结果展示了 ViT 骨干网络与所提出的多模态 SSL 算法 DINO-MM 两者的优势。

关键词

引用

@article{arxiv.2204.05381,
  title  = {Self-supervised Vision Transformers for Joint SAR-optical Representation Learning},
  author = {Yi Wang and Conrad M Albrecht and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2204.05381},
  year   = {2022}
}

备注

4 pages, 1 figure; IGARSS 2022