HRVQA:一种面向高分辨率航拍图像的视觉问答基准
计算机视觉与模式识别
2023-01-24 v1
摘要
视觉问答(VQA)是计算机视觉中一个重要且具有挑战性的多模态任务。近来,由于其在灾害监测、城市规划和数字地球产品生成中的潜在实际应用,已有一些工作尝试将 VQA 任务引入航拍图像。然而,航拍图像中物体在外观、尺度和方向上的巨大变化,以及缺乏良好标注的数据集,都制约了该领域 VQA 的发展。在本文中,我们引入了一个新数据集 HRVQA,其提供了收集的 53512 张 1024*1024 像素的航拍图像,以及半自动生成的 1070240 个问答对。为了对 VQA 模型理解航拍图像的能力进行基准测试,我们在 HRVQA 上评估了相关方法。此外,我们提出了一种带有门控注意力模块和互融合模块的新模型 GFTransformer。实验表明,所提出的数据集相当具有挑战性,尤其是与特定属性相关的问题。与先前最先进的方法相比,我们的方法取得了更优的性能。数据集与源代码将在 https://hrvqa.nl/ 发布。
引用
@article{arxiv.2301.09460,
title = {HRVQA: A Visual Question Answering Benchmark for High-Resolution Aerial Images},
author = {Kun Li and George Vosselman and Michael Ying Yang},
journal= {arXiv preprint arXiv:2301.09460},
year = {2023}
}