DUNIA:面向地球观测应用的基于跨模态对齐的像素级嵌入
计算机视觉与模式识别
2025-07-17 v2 机器学习
摘要
人们已投入大量精力将自监督多模态学习应用于地球观测任务。然而,当前大多数方法产生粗糙的块级嵌入,限制了它们的有效性以及与 LiDAR 等其他模态的整合。为弥补这一差距,我们提出了 DUNIA,这是一种通过图像与全波形 LiDAR 数据之间的跨模态对齐来学习像素级嵌入的方法。由于模型以对比方式进行训练,这些嵌入可以在零样本设置下直接用于各种环境监测任务。在我们的实验中,我们展示了这些嵌入在七项此类任务中的有效性:冠层高度制图、冠层覆盖率制图、土地覆盖制图、树种识别、植被面积指数、作物类型分类以及基于逐像素波形的垂直结构制图。结果表明,这些嵌入与零样本分类器结合,即使在低数据量情况下也通常优于专门的监督模型。在微调设置中,我们在六项任务中的五项上取得了接近或优于 SOTA 的强劲表现。
引用
@article{arxiv.2502.17066,
title = {DUNIA: Pixel-Sized Embeddings via Cross-Modal Alignment for Earth Observation Applications},
author = {Ibrahim Fayad and Max Zimmer and Martin Schwartz and Fabian Gieseke and Philippe Ciais and Gabriel Belouze and Sarah Brood and Aurelien De Truchis and Alexandre d'Aspremont},
journal= {arXiv preprint arXiv:2502.17066},
year = {2025}
}
备注
26 pages, 8 figures