中文

IdealGPT:利用大语言模型迭代分解视觉与语言推理

计算机视觉与模式识别 2025-04-14 v2 计算与语言

摘要

视觉与语言(VL)理解领域借助端到端大规模预训练 VL 模型(VLMs)取得了前所未有的进展。然而,在需要多步推理的零样本推理任务中它们仍显不足。为实现该目标,先前工作求助于分而治之的流程。本文中,我们认为先前努力存在若干固有缺陷:1)它们依赖特定领域的子问题分解模型。2)它们迫使模型在子问题或子答案提供的信息不足时仍预测最终答案。我们通过 IdealGPT 解决这些局限,该框架利用大语言模型(LLMs)迭代分解 VL 推理。具体而言,IdealGPT 利用一个 LLM 生成子问题,一个 VLM 提供相应子答案,另一个 LLM 进行推理以得到最终答案。这三个模块迭代执行分而治之过程,直至模型对主问题的最终答案具备信心。我们在零样本设定下的多个具挑战性 VL 推理任务上评估 IdealGPT。特别地,我们的 IdealGPT 在 VCR 上比现有最佳类 GPT-4 模型绝对提升 10%,在 SNLI-VE 上绝对提升 15%。代码见 https://github.com/Hxyou/IdealGPT

关键词

引用

@article{arxiv.2305.14985,
  title  = {IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models},
  author = {Haoxuan You and Zhecan Wang and Rui Sun and Long Chen and Gengyu Wang and Hammad A. Ayyubi and Kai-Wei Chang and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2305.14985},
  year   = {2025}
}

备注

13 pages, 5 figures