即插即用 VQA:通过拼接大型预训练模型实现零训练零样本 VQA
计算机视觉与模式识别
2023-03-21 v3
摘要
视觉问答(VQA)是视觉与语言推理的标志性任务,也是在零样本设定下的一个挑战性任务。我们提出即插即用 VQA(PNP-VQA),一种用于零样本 VQA 的模块化框架。与大多数需要对预训练语言模型(PLMs)针对视觉模态进行大量适配的现有工作不同,PNP-VQA 无需对 PLM 进行额外训练。相反,我们提出使用自然语言与网络解释作为将预训练模型粘合在一起的中间表示。我们首先生成问题引导的信息性图像描述,并将这些描述作为上下文传给 PLM 以进行问答。PNP-VQA 超越了端到端训练的基线,在零样本 VQAv2 与 GQA 上取得了最先进的结果。其以 11B 参数在 VQAv2 上超越 80B 参数的 Flamingo 模型 8.5%。以 738M PLM 参数,PNP-VQA 在 GQA 上相较具有 740M PLM 参数的 FewVLM 取得了 9.1% 的提升。代码发布于 https://github.com/salesforce/LAVIS/tree/main/projects/pnp-vqa
引用
@article{arxiv.2210.08773,
title = {Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training},
author = {Anthony Meng Huat Tiong and Junnan Li and Boyang Li and Silvio Savarese and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2210.08773},
year = {2023}
}
备注
EMNLP 2022 (Findings); correct typos in Equation 2 on page 4