中文

面向遥感视觉问答的多模态融合Transformer

计算机视觉与模式识别 2022-10-11 v1 人工智能

摘要

随着新一代卫星技术,遥感(RS)图像档案正快速增长。为使每幅RS图像的固有信息易于获取,视觉问答(VQA)被引入遥感领域。VQA允许用户针对RS图像内容提出自由形式的问题以提取通用信息。已有研究表明,输入模态(即图像与文本)的融合对VQA系统性能至关重要。当前多数融合方法在融合模块中使用模态特定表示,而非联合表示学习。然而,为发现图像与问题模态间的潜在关联,模型需学习联合表示,而非简单组合(如拼接、相加或相乘)模态特定表示。我们提出一种基于多模态Transformer的架构以克服该问题。所提架构包含三个主要模块:i)用于提取模态特定特征的特征提取模块;ii)融合模块,其利用用户定义数量的VisualBERT模型(VB)多模态Transformer层;iii)用于得出答案的分类模块。在RSVQAxBEN和RSVQA-LR数据集(由Sentinel-2图像的RGB波段构成)上的实验结果证明了VBFusion用于遥感VQA任务的有效性。为分析在VQA框架下使用其他光谱波段描述RS图像复杂内容的重要性,我们将RSVQAxBEN数据集扩展为包含Sentinel-2图像全部10m和20m空间分辨率的光谱波段。

关键词

引用

@article{arxiv.2210.04510,
  title  = {Multi-Modal Fusion Transformer for Visual Question Answering in Remote Sensing},
  author = {Tim Siebert and Kai Norman Clasen and Mahdyar Ravanbakhsh and Begüm Demir},
  journal= {arXiv preprint arXiv:2210.04510},
  year   = {2022}
}

备注

Accepted in SPIE Remote Sensing (ESI22R)