OlmoEarth:面向多模态地球观测的稳定潜在图像建模
计算机视觉与模式识别
2025-11-18 v1 机器学习
摘要
地球观测数据带来了独特的挑战:它像图像一样具有空间性,像视频或文本一样具有序列性,并且是高度多模态的。我们提出了OlmoEarth:一个多模态、时空基础模型,它采用了一种新颖的自监督学习公式、掩码策略和损失函数,这些均为地球观测领域而设计。与12个其他基础模型相比,OlmoEarth在多种研究基准和来自外部合作伙伴的真实世界任务中均达到了最先进的性能。在评估嵌入时,OlmoEarth在24项任务中的15项上取得了最佳性能;在全量微调下,它在29项任务中的19项上表现最佳。我们将OlmoEarth部署为一个端到端平台的主干,该平台用于地球观测模型的数据收集、标注、训练和推理。OlmoEarth平台将前沿基础模型和强大的数据管理工具交到致力于解决世界最大问题的非营利组织和非政府组织手中。OlmoEarth的源代码、训练数据和预训练权重可在https://github.com/allenai/olmoearth_pretrain获取。
引用
@article{arxiv.2511.13655,
title = {OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation},
author = {Henry Herzog and Favyen Bastani and Yawen Zhang and Gabriel Tseng and Joseph Redmon and Hadrien Sablon and Ryan Park and Jacob Morrison and Alexandra Buraczynski and Karen Farley and Joshua Hansen and Andrew Howe and Patrick Alan Johnson and Mark Otterlee and Ted Schmitt and Hunter Pitelka and Stephen Daspit and Rachel Ratner and Christopher Wilhelm and Sebastian Wood and Mike Jacobi and Hannah Kerner and Evan Shelhamer and Ali Farhadi and Ranjay Krishna and Patrick Beukema},
journal= {arXiv preprint arXiv:2511.13655},
year = {2025}
}