PyViT-FUSE:用于多传感器地球观测数据的基础模型
计算机视觉与模式识别
2025-04-29 v1 人工智能
机器学习
摘要
我们提出了 PyViT-FUSE,这是一个专为处理多模态遥感图像而设计的基础模型,通过注意力机制学习将任意数量的混合分辨率输入波段融合到单个表示中。学习到的 patch tokens 被进一步处理由堆叠的视觉变换器(vision transformer)处理,采用新颖的金字塔结构。我们以自监督方式在全球抽样数据集上训练,利用 SwAV 算法的核心概念。我们通过注意力得分的可视化展示了融合机制的可解释性,并展示了模型对下游任务的适用性。
引用
@article{arxiv.2504.18770,
title = {PyViT-FUSE: A Foundation Model for Multi-Sensor Earth Observation Data},
author = {Manuel Weber and Carly Beneke},
journal= {arXiv preprint arXiv:2504.18770},
year = {2025}
}
备注
11 pages, 13 figures, Published at ICLR 2025 - Machine Learning for Remote Sensing (ML4RS) Workshop