超越像素:在遥感图像视觉问答生成中整合常识知识
计算机视觉与模式识别
2026-02-24 v1
摘要
随着遥感图像档案的快速发展,针对图像提问已成为收集特定信息或执行语义图像检索的有效方式。然而,当前自动生成的提问往往简单且基于模板,限制了在实际应用中部署问答或视觉对话系统的能力。为充实和多样化包含图像内容和常识知识的提问,我们提出了一种基于知识的遥感图像视觉问答生成模型(KRSVQG)。该模型整合来自外部知识来源的相关知识三元组,以拓宽提问内容,同时采用图像描述作为中间表征,将提问 grounding 到对应图像。此外,KRSVQG 采用视觉语言预训练和 fine-tuning 策略,使模型能够适应数据稀缺的场景。为评估所提出的 KRSVQG 模型,我们构建了两个知识感知的遥感图像视觉问答生成数据集:NWPU-300 数据集和 TextRS-300 数据集。包括指标和人类评估在内的评估表明,KRSVQG 在现有方法之上取得了优异性能,lead to rich questions,这些问题同时以图像和领域知识为grounding。作为视觉语言研究中的关键实践,知识感知的视觉问答生成促进了对图像内容超越像素的理解,推动了具备 vision-grounded 人类常识的知识丰富视觉语言系统的发展。
引用
@article{arxiv.2602.19217,
title = {Questions beyond Pixels: Integrating Commonsense Knowledge in Visual Question Generation for Remote Sensing},
author = {Siran Li and Li Mi and Javiera Castillo-Navarro and Devis Tuia},
journal= {arXiv preprint arXiv:2602.19217},
year = {2026}
}