中文

TerraMind:地球观测的大规模生成式多模态模型

计算机视觉与模式识别 2025-09-11 v4 人工智能

摘要

我们提出了 TerraMind,这是首个用于地球观测 (EO) 的任何到任何生成式多模态基础模型。与其他多模态模型不同,TerraMind 采用双尺度表示,融合跨模态的 token 级别和像素级别数据。在 token 级别,TerraMind 编码高级上下文信息以学习跨模态关系;而在像素级别,TerraMind 利用细粒度表示来捕获关键空间细微差别。我们在九种地理空间模态的全球大规模数据集上进行预训练。在本文中,我们展示了(i)TerraMind 的双尺度早期融合方法为地球观测打开一系列零样学习和少样本应用;(ii)TerraMind 引入了“模态思考” (Thinking-in-Modalities, TiM) —— 在微调和推理期间生成额外人工数据的能力,以提高模型输出;(iii)TerraMind 在诸如 PANGAEA 等社区标准基准测试中实现了超越当前最先进的性能。预训练数据集、模型权重以及我们的代码均在宽松许可证下开源。

关键词

引用

@article{arxiv.2504.11171,
  title  = {TerraMind: Large-Scale Generative Multimodality for Earth Observation},
  author = {Johannes Jakubik and Felix Yang and Benedikt Blumenstiel and Erik Scheurer and Rocco Sedona and Stefano Maurogiovanni and Jente Bosmans and Nikolaos Dionelis and Valerio Marsocci and Niklas Kopp and Rahul Ramachandran and Paolo Fraccaro and Thomas Brunschwiler and Gabriele Cavallaro and Juan Bernabe-Moreno and Nicolas Longépé},
  journal= {arXiv preprint arXiv:2504.11171},
  year   = {2025}
}

备注

Accepted at ICCV'25