KIRA:面向专业视觉领域的知识驱动图像检索与推理架构
计算机视觉与模式识别
2026-04-27 v1
摘要
检索增强生成(RAG)已在文本问答领域取得变革性进展,但其在视觉领域的扩展仍面临根本性挑战:桥接图像查询与文本密集型知识库之间的模态鸿沟、构建语义有意义的视觉知识库、对检索到的图像进行多跳推理,以及验证生成答案是否忠实地依赖于视觉证据。我们提出KIRA(Knowledge Intensive Image Retrieval and Reasoning Architecture),一个统一的五阶段框架,解决视觉RAG的十个核心问题。KIRA引入:(1)基于DINO的分层语义块化,用于多粒度知识库构建;(2)具有少样本适应的领域自适应对比编码器,用于处理罕见视觉概念;(3)具备链式思考查询扩展的双路径跨模态检索;(4)支持时序和多视角的链式检索,用于多跳视觉推理;(5)基于证据的受控生成与事后幻觉验证。我们还提出DOMAINVQAR基准套件,沿三个维度(检索精度、推理忠实性和领域正确性)评估视觉RAG,超越标准召回指标。实验覆盖医学胸片、电路图、卫星图像和组织病理学四个专业领域,采用渐进式六变体消融实验表明,KIRA在各领域平均实现0.97的检索精度、1.0的 grounding 分数和0.707的领域正确性。消融实验揭示了每个组件何时有助于提高性能,以及何时会引入精度多样性权衡。代码将在接受后发布。
引用
@article{arxiv.2604.16915,
title = {KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains},
author = {Parthaw Goswami and Jaynto Goswami Deep},
journal= {arXiv preprint arXiv:2604.16915},
year = {2026}
}