中文

GAIR:基于地理对齐的自监督对比预训练的定位感知方法

计算机视觉与模式识别 2026-04-22 v2 人工智能

摘要

Vision Transformer (ViT) 已在计算机视觉任务中广泛应用,提供整幅图像或图像块的表征。然而,ViT 在应用于涉及多种地理空间数据模态的任务(如俯瞰遥感数据、地面级图像和地理空间矢量数据)时,缺乏任意位置的细粒度局部图像表征。高分辨率的局部表征对建模跨模态的地理空间关系和对齐至关重要。我们提出通过扩展 ViT 的神经隐式表征 (INR) 模块,引入 Neural Implicit Local Interpolation,生成覆盖 RS 图像任意位置的连续 RS 图像表征。基于 INR 模块,我们引入 GAIR——一种集成俯瞰 RS 数据、街景 (SV) 图像及其地理位置元数据的、面向定位的自监督学习 (SSL) 目标。GAIR 使用三个分解的神经编码器将不同模态映射到嵌入空间,并利用 INR 模块对这些表征进行地理对齐,对 unlabeled 数据进行对比学习训练。在 9 个地理空间任务和 22 个数据集上进行评估(涵盖 RS 图像基、SV 图像基和位置嵌入基基准)。实验结果表明,GAIR 在不使用细粒度地理对齐空间表征的 GeoFM 和替代 SSL 训练目标(如 MoCo V3 和 MAE)方面性能更优。我们的结果凸显了 GAIR 在跨任务、跨空间尺度和跨时间上下文中学习通用地理空间表征的有效性。项目代码已公开于 https://github.com/zpl99/GAIR。

关键词

引用

@article{arxiv.2503.16683,
  title  = {GAIR: Location-Aware Self-Supervised Contrastive Pre-Training with Geo-Aligned Implicit Representations},
  author = {Zeping Liu and Ni Lao and Zhangyu Wang and Junfeng Jiao and Gengchen Mai},
  journal= {arXiv preprint arXiv:2503.16683},
  year   = {2026}
}

备注

Accepted by ISPRS Journal of Photogrammetry and Remote Sensing