中文

MetaEarth-MM:基于场景中心联合建模的统一多模态遥感图像生成

计算机视觉与模式识别 2026-05-20 v1

摘要

多模态遥感图像是地球观测的关键,但实际应用中常缺乏完整的配对观测。现有生成方法通常通过孤立的两两模态转换来解决此问题,但随着模态数量和生成任务的增加,其灵活性和可扩展性仍受限。本文开发了遥感图像生成基础模型 MetaEarth-MM,实现了跨五种模态的配对联合生成和任意到任意转换。我们引入基于场景的联合建模范式。不同于依赖直接外观级别跨模态映射的前述方法,MetaEarth-MM 将生成组织在底层场景内容之上。具体而言,MetaEarth-MM 采用解耦架构,首先从可用观测中推断场景潜在表示,然后以此为条件生成目标模态。为支持训练,我们进一步构建了 EarthMM 数据集,包含 280 万张多分辨率全球图像,配对数据达 220 万对。广泛实验表明,MetaEarth-MM 不仅具备强大的生成能力和鲁健的跨任务泛化能力,还能在数据和表示层面支持下游任务,凸显其作为跨模态地球观测通用基础模型的潜力。代码和数据集将在 https://github.com/YZPioneer/MetaEarth-MM 提供。

关键词

引用

@article{arxiv.2605.20090,
  title  = {MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling},
  author = {Zhiping Yu and Chenyang Liu and Jinqi Cao and Qinzhe Yang and Siwei Yu and Zhengxia Zou and Zhenwei Shi},
  journal= {arXiv preprint arXiv:2605.20090},
  year   = {2026}
}