中文

StaR-KVQA:结构化推理痕迹用于隐式知识视觉问答

计算机视觉与模式识别 2026-03-24 v3 人工智能

摘要

知识驱动的视觉问答(KVQA)要求模型在图像中对实体进行 grounding,并推理。近期工作引入其隐式知识变体 IK-KVQA,仅依赖多模态大语言模型(MLLM)作为知识来源,答案无需外部检索。现有 IK-KVQA 方法通常仅基于答案进行监督:推理过程隐式化,依据往往弱且不一致,标准监督微调(SFT)后泛化性差。我们提出 StaR-KVQA 框架,为 IK-KVQA 引入双路径结构化推理痕迹——关于文本与视觉的符号关系路径以及基于路径的自然语言解释——提供强于通用答案监督的归纳偏置。这些痕迹作为模态感知的脚手架,引导模型聚焦相关实体与属性,结构性强于通用链式思考监督,却不限制推理固定路径。仅用单个开源 MLLM,StaR-KVQA 构建并筛选痕迹,构建离线痕迹丰富数据集,再进行结构感知自蒸馏;无需外部检索器、验证器或精心构建的知识库,推理仅需一次自回归前向传播。跨基准测试,StaR-KVQA 稳定提升答案准确率与中间推理透明度,在 OK-VQA 上相较于最强基线提升最高达 11.3%。

关键词

引用

@article{arxiv.2510.06638,
  title  = {StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering},
  author = {Zhihao Wen and Wenkang Wei and Yuan Fang and Xingtong Yu and Hui Zhang and Weicheng Zhu and Xin Zhang},
  journal= {arXiv preprint arXiv:2510.06638},
  year   = {2026}
}

备注

8+3+3 pages, code: https://github.com/jianyingzhihe/StaR-KVQA