从图像到文本提示:基于冻结大语言模型的零样本视觉问答
计算机视觉与模式识别
2023-05-09 v3 多媒体
摘要
大语言模型(LLMs)已展现出对新语言任务的优异零样本泛化能力。然而,有效利用 LLMs 进行零样本视觉问答(VQA)仍具挑战,主要源于 LLM 与 VQA 任务间的模态断裂与任务断裂。对视觉与语言数据的端到端训练或可弥合这些断裂,但缺乏灵活性且计算昂贵。为解决此问题,我们提出 \emph{Img2Prompt},一个即插即用模块,提供可桥接上述模态与任务断裂的提示,使 LLMs 无需端到端训练即可执行零样本 VQA 任务。为提供此类提示,我们进一步采用 LLM 无关的模型来给出描述图像内容与自构建问答对的提示,从而有效引导 LLM 执行零样本 VQA 任务。Img2Prompt 具有以下优势:1)可灵活配合多种 LLM 执行 VQA。2)无需端到端训练,显著降低部署 LLM 用于零样本 VQA 任务的成本。3)取得与依赖端到端训练的方法相当或更优的性能。例如,我们在 VQAv2 上以 5.6\% 优于 Flamingo \cite{Deepmind:Flamingo2022}。在具挑战性的 A-OKVQA 数据集上,我们的方法甚至以多达 20\% 优于少样本方法。
引用
@article{arxiv.2212.10846,
title = {From Images to Textual Prompts: Zero-shot VQA with Frozen Large Language Models},
author = {Jiaxian Guo and Junnan Li and Dongxu Li and Anthony Meng Huat Tiong and Boyang Li and Dacheng Tao and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2212.10846},
year = {2023}
}
备注
CVPR 2023 Camera Ready Version