多遥感图像模态的视觉问答
计算机视觉与模式识别
2025-05-22 v1
摘要
视觉特征提取是视觉问答(VQA)中的关键步骤。构建良好的场景视觉表征是系统正确理解后续内容以作出正确答案的关键。在遥感领域,视觉特征提取步骤可从多个携带互补光谱、空间和上下文信息的图像模态中获益。本文提出在遥感语境下将多图像模态引入VQA,形成计算机视觉社区的新任务。为此,我们引入了新的VQA数据集,命名为TAMMI(Text and Multi-Modal Imagery),包含关于由三种不同模态(超高分辨率RGB、多光谱成像数据和合成孔径雷达)描述的场景的多样化问题。通过自动化管道,该数据集可根据实验需求轻松扩展。我们还提出了MM-RSVQA(Multi-modal Multi-resolution Remote Sensing Visual Question Answering)模型,基于VisualBERT(一种视觉语言变换器),通过可训练的融合过程有效地组合多个图像模态和文本。初步实验结果显示,我们的方法在该具有挑战性的数据集上表现前景广阔,在目标VQA任务中达到65.56%的准确率。这一开创性工作为社区在其他成像领域(如医学成像)开展多模态多分辨率VQA任务铺平了道路,其中多模态可丰富场景的视觉表征。数据集和代码已提供于https://tammi.sylvainlobry.com/。
关键词
引用
@article{arxiv.2505.15401,
title = {Visual Question Answering on Multiple Remote Sensing Image Modalities},
author = {Hichem Boussaid and Lucrezia Tosato and Flora Weissgerber and Camille Kurtz and Laurent Wendling and Sylvain Lobry},
journal= {arXiv preprint arXiv:2505.15401},
year = {2025}
}
备注
EARTHVISION 2025 8 pages, 1 page of supplementary material, 4 figures