GEOBIND:通过卫星图像将文本、图像和音频进行绑定
人工智能
2024-04-19 v1
摘要
在遥感领域,我们关注对某些地理位置的多种模态进行建模。已有研究聚焦于地点与地貌类型、可居住性、音频、文本描述等之间的关系。最近,一种常见的方法是训练深度学习模型,使用卫星图像推断地点的某些独特特征。本文提出了一种深度学习模型GeoBind,能够从地点的卫星图像中推断多个模态,具体包括文本、图像和音频。为此,我们将卫星图像作为绑定元素,将所有其他模态与卫星图像数据进行对齐。我们的训练结果生成了一个包含多种数据类型的联合嵌入空间:卫星图像、地面图像、音频和文本。此外,我们的方法不需要包含上述所有模态的单个复杂数据集,而只需要多个卫星图像配对数据。虽然我们仅对齐了三个模态,但本文提出了一个通用框架,可用于创建包含任意数量模态的嵌入空间,方法是将卫星图像作为绑定元素。我们的结果表明,与传统单模态模型不同,GeoBind具有广泛的适用性,能够对给定卫星图像输入进行多模态推理。
引用
@article{arxiv.2404.11720,
title = {GEOBIND: Binding Text, Image, and Audio through Satellite Images},
author = {Aayush Dhakal and Subash Khanal and Srikumar Sastry and Adeel Ahmad and Nathan Jacobs},
journal= {arXiv preprint arXiv:2404.11720},
year = {2024}
}
备注
2024 IEEE International Geoscience and Remote Sensing Symposium