EarthVQA:迈向可查询地球——基于关系推理的遥感视觉问答
计算机视觉与模式识别
2023-12-20 v1
摘要
地球视觉研究通常侧重于提取地理空间对象的位置和类别,却忽视了对对象间关系及综合推理的探索。基于城市规划需求,我们开发了一个多模态多任务视觉问答(VQA)数据集(EarthVQA),以推进基于关系推理的判定、计数和综合分析。EarthVQA 数据集包含 6000 张图像、相应的语义掩码以及 208,593 个问答对,其中嵌入了城乡治理需求。鉴于对象是复杂关系推理的基础,我们提出了语义对象感知框架(SOBA),以对象为中心的方式推进 VQA 研究。为保留精细的空间位置和语义信息,SOBA 利用分割网络生成对象语义。对象引导的注意力机制通过伪掩码聚合对象内部特征,而双向交叉注意力则进一步分层建模对象外部关系。为优化对象计数,我们提出了一种数值差异损失,动态增加差异惩罚,从而统一分类和回归任务。实验结果表明,SOBA 优于先进的通用方法和遥感方法。我们相信该数据集和框架为地球视觉的复杂分析提供了强有力的基准。项目页面位于 https://Junjue-Wang.github.io/homepage/EarthVQA。
引用
@article{arxiv.2312.12222,
title = {EarthVQA: Towards Queryable Earth via Relational Reasoning-Based Remote Sensing Visual Question Answering},
author = {Junjue Wang and Zhuo Zheng and Zihang Chen and Ailong Ma and Yanfei Zhong},
journal= {arXiv preprint arXiv:2312.12222},
year = {2023}
}
备注
Accepted By AAAI 2024