用于遥感图像描述与检索的大语言模型
计算机视觉与模式识别
2024-02-12 v1
摘要
图像描述和跨模态检索是涉及视觉和语言信息联合分析的任务示例。在遥感图像方面,这些任务可以帮助非专业用户提取相关的地球观测信息,以用于各种应用。尽管已有一些先前的努力,但由于先前研究中使用的可用数据集和模型规模相对较小,视觉和语言模型在遥感领域的开发和应用受到了阻碍。在这项工作中,我们提出了 RS-CapRet,一种用于遥感任务(特别是图像描述和文本-图像检索)的视觉与语言方法。我们特别提出使用一个高能力的大型解码器语言模型,以及通过对比语言-图像预训练适应遥感图像的图像编码器。为了将图像编码器和语言解码器连接起来,我们提出利用结合不同遥感图像描述数据集的样本训练简单的线性层,同时保持其他参数冻结。随后,RS-CapRet 能够为遥感图像生成描述并根据文本描述检索图像,实现了 SOTA 或与现有方法相当的竞争性能。定性结果表明,RS-CapRet 能够有效利用预训练的大语言模型来描述遥感图像,基于不同类型的查询检索图像,并展示了以对话方式处理图像和文本交错序列的能力。
引用
@article{arxiv.2402.06475,
title = {Large Language Models for Captioning and Retrieving Remote Sensing Images},
author = {João Daniel Silva and João Magalhães and Devis Tuia and Bruno Martins},
journal= {arXiv preprint arXiv:2402.06475},
year = {2024}
}