EarthMind:利用跨传感器数据与统一多模态LLM实现高级地球观测解译
计算机视觉与模式识别
2025-09-30 v2
摘要
地球观测(EO)数据分析对于监测环境与人类动态至关重要。近期多模态大语言模型(MLLM)在EO理解方面展现出潜力,但仍局限于单传感器输入,忽略了异构模态间的互补性。我们提出EarthMind,这是一个统一的视觉-语言框架,通过创新的分层跨模态注意力(即HCA)设计处理单传感器与跨传感器输入。具体而言,HCA分层捕获跨传感器的视觉关系,并将其与语言查询对齐,实现光学与合成孔径雷达(SAR)特征的自适应融合。为支持跨传感器学习,我们整理了FusionEO,一个包含3万对数据及多样化标注的数据集,并建立了EarthMind-Bench,一个包含2,841对数据并带有专家标注的感知与推理任务基准。大量实验表明,EarthMind在EarthMind-Bench上取得了最先进的结果,并在多个EO基准上超越了现有的MLLM。
引用
@article{arxiv.2506.01667,
title = {EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM},
author = {Yan Shu and Bin Ren and Zhitong Xiong and Danda Pani Paudel and Luc Van Gool and Begüm Demir and Nicu Sebe and Paolo Rota},
journal= {arXiv preprint arXiv:2506.01667},
year = {2025}
}