中文

面向遥感数据的自监督音视频表征学习

计算机视觉与模式识别 2024-08-22 v2

摘要

当前许多深度学习方法广泛利用在 ImageNet 等大型数据集上预训练的骨干网络,然后对其进行微调以执行特定任务。在遥感领域,缺乏可比的大型标注数据集以及传感平台的广泛多样性阻碍了类似的发展。为了促进遥感领域预训练骨干网络的可用性,我们设计了一种用于预训练深度神经网络的自监督方法。通过利用地理标记音频记录与遥感影像之间的对应关系,这一过程以完全无标签的方式进行,消除了繁琐人工标注的需求。为此,我们引入了 SoundingEarth 数据集,其由全球各地共址的航拍影像与音频样本组成。使用该数据集,我们随后预训练 ResNet 模型,将两种模态的样本映射到一个共同的嵌入空间中,从而促使模型理解影响视觉与听觉外观的场景关键属性。为验证所提方法的有效性,我们评估了所获预训练权重相对于通过其他方式获得权重的迁移学习性能。通过在多个常用遥感数据集上微调模型,我们表明我们的方法优于现有的遥感影像预训练策略。数据集、代码及预训练模型权重将在 https://github.com/khdlr/SoundingEarth 提供。

关键词

引用

@article{arxiv.2108.00688,
  title  = {Self-supervised Audiovisual Representation Learning for Remote Sensing Data},
  author = {Konrad Heidler and Lichao Mou and Di Hu and Pu Jin and Guangyao Li and Chuang Gan and Ji-Rong Wen and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2108.00688},
  year   = {2024}
}

备注

Published Journal Version