AeroRAG:面向细粒度航空视觉推理的结构化多模态检索增强大语言模型
计算机视觉与模式识别
2026-04-21 v1
摘要
尽管近期进展显著,但航空场景下的可靠视觉问答仍具挑战。在此类场景中,关键证据往往体现在小目标、显式数量、粗略位置及目标间关系上,而传统稠密视觉标记表示与这些结构化语义不匹配。为解决此接口失配,我们提出AeroRAG,一种引导场景图的多模态检索增强生成框架,用于视觉问答。该框架首先将输入图像转换为结构化视觉知识,包括目标类别、数量、空间位置及语义关系,然后检索与查询相关的语义块,以构建大语言模型的紧凑提示。我们不依赖稠密视觉标记直接推理,而是引入感知与语言推理之间的更明确的中间接口。在AUG航空数据集和通用领域VG-150基准上实验显示,我们的方法对六大强大MLLM基线均实现一致提升,尤其在密集航空场景和关系敏感推理中提升最大。我们进一步在VQAv2上评估,验证该接口与标准视觉推理设置兼容。这些结果表明,结构化检索是面向部署且具 grounding 能力的视觉推理系统的实用设计方向。
引用
@article{arxiv.2604.17889,
title = {AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning},
author = {Junxiao Xue and Quan Deng and Tingqi Hu and Meicong Si and Xinyi Yin and Yunyun Shi and Xuecheng Wu},
journal= {arXiv preprint arXiv:2604.17889},
year = {2026}
}