中文

面向多模态推理的指令调校自提问框架

计算机视觉与模式识别 2025-09-26 v1 人工智能

摘要

视觉语言理解领域近年来因大型语言模型 (LLM) 的发展而取得了显著进展。然而即便是非常简单的提问,当前方法也需要帮助解决需要多步推理的问题。最近的研究采用 LLM 通过迭代生成子问题和答案来解决这一问题。然而存在若干缺点:1)由于 LLM 无法读取视觉信息,无法获取图像中细粒度的视觉内容;2)内部机制不可见且难以通过使用黑盒 LLM 来复现。为解决这些问题,我们提出了 SQ (Self-Questioning)-InstructBLIP,通过生成图像感知的有信息子问题和子答案来提高推理性能。SQ-InstructBLIP 由 Questioner、Answerer 和 Reasoner 组成,它们共享相同的架构。Questioner 和 Answerer 生成有助于推断主问题的子问题和子答案,Reasoner 在考虑所生成子问题信息后对主问题进行推理。我们的实验表明,所提出的方法 SQ-InstructBLIP 在解决 VQA 任务时,将生成的子问题作为额外信息使用,比以前的工作进行更准确的推理。

关键词

引用

@article{arxiv.2509.21251,
  title  = {Instruction-tuned Self-Questioning Framework for Multimodal Reasoning},
  author = {You-Won Jang and Yu-Jung Heo and Jaeseok Kim and Minsu Lee and Du-Seong Chang and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2509.21251},
  year   = {2025}
}

备注

This paper was accepted to the "CLVL: 5th Workshop on Closing the Loop Between Vision and Language (ICCV 2023 CLVL workshop)."