基于交叉注意力与多模态信息瓶颈的遥感视觉问答
计算机视觉与模式识别
2023-06-27 v1 计算与语言
机器学习
摘要
在本研究中,我们处理遥感中的视觉问答 (VQA) 问题。尽管遥感图像包含对识别与物体检测任务具有重要意义的信息,但由于高维度、体量与冗余性,它们在处理上构成了巨大挑战。此外,将图像信息与语言特征联合处理增添了额外约束,例如映射对应的图像与语言特征。为处理该问题,我们提出了一种结合信息最大化的交叉注意力方法。基于 CNN-LSTM 的交叉注意力突出了图像与语言模态中的信息并建立二者间的联系,而信息最大化学习一个低维瓶颈层,其包含执行 VQA 任务所需的全部相关信息。我们在两个不同分辨率的 VQA 遥感数据集上评估了我们的方法。对于高分辨率数据集,我们在两个测试集上分别取得了 79.11% 和 73.87% 的总体精度;对于低分辨率数据集,我们取得了 85.98% 的总体精度。
引用
@article{arxiv.2306.14264,
title = {Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck},
author = {Jayesh Songara and Shivam Pande and Shabnam Choudhury and Biplab Banerjee and Rajbabu Velmurugan},
journal= {arXiv preprint arXiv:2306.14264},
year = {2023}
}