中文

MPCAR:用于增强大视觉语言模型中视觉推理的多视角情境增强

计算机视觉与模式识别 2025-08-19 v1

摘要

尽管取得了显著进展,大型视觉语言模型(Large Vision-Language Models,LVLMs)在需要深层情境理解、多角度分析或细致细节识别的复杂视觉推理任务中仍面临挑战。现有方法常依赖单次图像编码和提示,限制了其充分捕获细微视觉信息的能力。鼓舞人心的观念是,战略性生成的"额外"信息可作为有益的情境增强。为此,我们提出了 Multi-Perspective Contextual Augmentation for Reasoning(MPCAR),这是一种旨在增强 LVLMs 性能的新型推理时策略。MPCAR 在三个阶段中运作:首先,LVLMs 从各种角度生成N 个多样且互补的描述或初步推理路径;其次,这些描述被智能地与原始问题整合,以构建综合的情境增强提示;最后,该丰富的提示指导 LVLMs 进行深层推理和最终答案生成。关键的是,MPCAR 实施这些改进而无需对底层 LVLMs 的参数进行任何微调。对 GQA、VQA-CP v2 和 ScienceQA(Image-VQA)等具挑战性视觉问答数据集上的大量实验表明,MPCAR 在所有已建立的基准方法上均表现出色。我们的定量结果显示,在需要强鲁棒情境理解的任务上取得显著的准确率提升,而人类评估则证实了所生成答案的连贯性和完整性的提高。消融研究进一步突显了多样化提示模板和生成视角数量的重要性。这一工作凸显了利用 LVLMs 内在的生成能力来丰富输入情境,从而解锁其为复杂多模态任务进行推理的潜能之有效性。

关键词

引用

@article{arxiv.2508.12400,
  title  = {MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models},
  author = {Amirul Rahman and Qiang Xu and Xueying Huang},
  journal= {arXiv preprint arXiv:2508.12400},
  year   = {2025}
}