面向遥感图像变更检索与描述的多模态框架
计算机视觉与模式识别
2024-06-21 v1 机器学习
摘要
最近,越来越多的关注力度集中在将文本与其他模态(如图像、音频和视频)集成,以促进与多模态AI系统的自然语言交互的多模态应用上。尽管涉及标准模态的应用已经得到广泛探索,但对于特定数据模态(如遥感数据)的研究仍显不足。尽管遥感数据的众多潜在应用(包括环境保护、灾害监测和土地规划)为人所知,但现有解决方案主要聚焦于特定任务,如分类、描述和检索,常常忽视了遥感数据独特特征——其能够系统性地提供同一地理区域随时间变化的信息。这种能力使得对底层景观的持续监测成为可能。为此,我们提出了一种用于双时相遥感图像对的新型基础模型,结合对比学习和LEVIR-CC数据集,既用于描述生成,也用于文本-图像检索。在联合训练对比编码器和描述解码器的过程中,我们的模型在双时相变更检测的语境下,赋予了文本-图像检索能力,同时保持与先进技术相当的描述性能。我们将发布源代码和预训练权重,地址为:https://github.com/rogerferrod/RSICRC。
引用
@article{arxiv.2406.13424,
title = {Towards a multimodal framework for remote sensing image change retrieval and captioning},
author = {Roger Ferrod and Luigi Di Caro and Dino Ienco},
journal= {arXiv preprint arXiv:2406.13424},
year = {2024}
}