通过链式问题引导检索增强生成,提升多模态 LLM 在视觉问答中的表现
计算机视觉与模式识别
2026-05-06 v1
摘要
随着多模态研究和深度学习的进展,多模态大型语言模型 (Multimodal Large Language Models, MLLMs) 已成为解决多模态任务的强大范式。作为视觉语言研究中的核心问题,视觉问答 (Visual Question Answering, VQA) 正越来越多地采用 MLLMs 以提升性能,尤其是在需要外部知识的开放域场景中。本文旨在通过更有效地整合 MLLMs 与结构化推理及知识获取,进一步提升基于检索的 VQA。我们引入一种逻辑引导策略,将链式思维 (Chain-of-Thought, CoT) 推理与视觉问题分解 (Visual Question Decomposition, VQD) 融合,称为 CoVQD,以引导检索更准确、更相关的知识用于 MLLM 推理。基于此思想,我们提出一种新框架:CoVQD 引导的检索增强生成 (CoVQD-guided RAG, CgRAG),使 MLLMs 能够访问更全面且连贯的外部知识,同时从结构化视觉-文本推理指导中获益,从而在复杂跨域 VQA 场景中提升泛化能力和可靠性。在 E-VQA、InfoSeek 和 OKVQA 等基准上的大量实验表明,所提方法有效。
引用
@article{arxiv.2605.03790,
title = {Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation},
author = {Quanxing Xu and Ling Zhou and Xian Zhong and Xiaohua Huang and Rubing Huang and Chia-Wen Lin},
journal= {arXiv preprint arXiv:2605.03790},
year = {2026}
}