中文

面向鲁棒遥感视觉问答的文本引导的粗到细融合网络

计算机视觉与模式识别 2025-01-14 v2

摘要

遥感视觉问答(RSVQA)已引起广泛关注。然而,当前RSVQA方法受限于光学传感器的成像机制,尤其在云覆盖和低光照等挑战条件下表现不佳。鉴于合成孔径雷达(SAR)的全时、全天候成像能力,如何将光学-SAR 图像集成以提高RSVQA性能尤为关键。本文提出一种文本引导的粗到细融合网络(TGFNet),通过问题文本与多源图像之间的语义关系引导网络在特征层面实现互补融合。具体而言,我们开发了文本引导的粗到细注意力细化(CFAR)模块,以聚焦于复杂遥感图像中与问题相关的关键区域。该模块通过关键区域路由逐步将注意力从宽泛区域引导到更细致的细节,从而增强模型聚焦于相关区域的能力。此外,我们提出了自适应多专家融合(AMEF)模块,动态整合不同专家,实现光学和 SAR 特征的自适应融合。我们还创建了第一个针对光学-SAR RSVQA 方法的大规模基准数据集,包含 6008 对对齐的光学-SAR 图像对和 1036694 条标注良好的问答对,覆盖 16 种多样化的问答类型,包括复杂关系推理问题。在所提数据集上进行的广泛实验表明,TGFNet 有效地整合了光学和 SAR 图像中的互补信息,显著提升了模型在挑战场景下的性能。数据集可在 https://github.com/mmic-lcl/ 获取。索引词:遥感视觉问答、多源数据融合、多模态、遥感、光学-SAR。

关键词

引用

@article{arxiv.2411.15770,
  title  = {Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering},
  author = {Zhicheng Zhao and Changfu Zhou and Yu Zhang and Chenglong Li and Xiaoliang Ma and Jin Tang},
  journal= {arXiv preprint arXiv:2411.15770},
  year   = {2025}
}