中文

GeoViSTA:用于多模态环境表征的地理空间视觉-表格 Transformer

机器学习 2026-05-15 v1 计算机视觉与模式识别

摘要

对地球观测图像的大规模预训练产生了对自然和建筑环境的强大表征。然而,大多数现有的地理空间基础模型并未直接对通常以表格形式存储的结构化社会经济协变量进行建模。这种模态差距限制了它们捕捉完整总体环境的能力,而这对于推理复杂的环境、社会和健康相关结果至关重要。在这项工作中,我们提出了 GeoViSTA (Geospatial Vision-Tabular Transformer),这是一种从配准的网格化图像和表格数据中学习统一地理空间嵌入的视觉-表格架构。GeoViSTA 利用双向交叉注意力跨模态交换空间和语义信息,并由地理感知注意力机制引导,该机制将连续图像块与不规则普查区标记对齐。我们使用自监督联合掩码自编码目标训练 GeoViSTA,迫使其利用局部空间上下文和跨模态线索恢复缺失的图像块和表格行。从经验上看,GeoViSTA 的统一嵌入提高了在重大影响力下游任务上的线性探测性能,在预测留出区域特定疾病死亡率和火灾危险频率方面优于基线。这些结果表明,将物理环境与结构化社会经济上下文联合建模,可为整体地理空间推理产生高度可迁移的表征。

关键词

引用

@article{arxiv.2605.14406,
  title  = {GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation},
  author = {Yuhao Liu and Sadeer Al-Kindi and Ashok Veeraraghavan and Guha Balakrishnan},
  journal= {arXiv preprint arXiv:2605.14406},
  year   = {2026}
}