面向遥感图像的知识感知视觉问答生成
计算机视觉与模式识别
2026-02-24 v1
摘要
随着遥感图像档案的快速发展,通过图像提问已成为收集特定信息或执行图像检索的有效方式。然而,自动生成的基于图像的问题往往简单且基于模板,限制了基于问答或视觉对话系统的实际部署。为丰富和多样化问题,我们提出了一种知识感知遥感视觉问答生成模型 KRSVQG,该模型整合与图像内容相关的外部知识,以提高生成问题的质量和语境理解能力。该模型以图像和来自外部知识源的相关知识三元组为输入,利用图像描述作为中间表示,以增强生成问题的图像 grounding 能力。为评估 KRSVQG 的性能,我们手动标注了两个数据集:NWPU-300 和 TextRS-300。这两个数据集上的结果表明,KRSVQG 优于现有方法,生成的问题在图像和领域知识方面都更具知识丰富性和 grounding 能力。
引用
@article{arxiv.2602.19224,
title = {Knowledge-aware Visual Question Generation for Remote Sensing Images},
author = {Siran Li and Li Mi and Javiera Castillo-Navarro and Devis Tuia},
journal= {arXiv preprint arXiv:2602.19224},
year = {2026}
}