中文

分析视觉问答分解的模块化方法

计算机视觉与模式识别 2023-11-14 v1 计算与语言

摘要

最近研究表明,无需额外训练的模块化神经网络在具有挑战性的视觉-语言任务上超越了端到端神经网络。此类最新方法同时引入了基于 LLM 的代码生成来构建程序,以及若干技能特定、任务导向的模块来执行这些程序。在本文中,我们聚焦于 ViperGPT,并探究其额外性能的来源,以及其中多少归功于其包含的(最先进的端到端)BLIP-2 模型,多少归功于额外的符号组件。为此,我们进行了一项受控研究(在多个 VQA 基准上比较端到端、模块化和基于提示的方法)。我们发现,ViperGPT 相对于 BLIP-2 的报道增益可归因于其对任务特定模块的选择,而当我们使用更任务不可知的一组模块运行 ViperGPT 时,这些增益消失。此外,如果我们对其模块选择进行显著改动(例如移除或仅保留 BLIP-2),ViperGPT 仍保留其大部分性能。最后,我们将 ViperGPT 与基于提示的分解策略进行比较,发现在某些基准上,模块化方法通过用自然语言而非代码表示子任务而显著受益。

关键词

引用

@article{arxiv.2311.06411,
  title  = {Analyzing Modular Approaches for Visual Question Decomposition},
  author = {Apoorv Khandelwal and Ellie Pavlick and Chen Sun},
  journal= {arXiv preprint arXiv:2311.06411},
  year   = {2023}
}

备注

Published at EMNLP 2023 (Main Conference). Source code: https://github.com/brown-palm/visual-question-decomposition