PromptCap:提示引导的任务感知图像描述生成
计算机视觉与模式识别
2023-08-21 v4 计算与语言
摘要
基于知识的视觉问答(VQA)涉及需要图像之外的世界知识才能得出正确答案的问题。像GPT-3这样的大型语言模型(LM)因其强大的知识检索和推理能力对该任务尤为有用。为使LM理解图像,已有工作使用描述生成模型将图像转换为文本。然而,在用单一描述句子概括图像时,应描述哪些视觉实体往往不明确。通用图像描述常遗漏LM正确回答视觉问题所必需的视觉细节。为应对此挑战,我们提出PromptCap(提示引导的图像描述生成),一种旨在作为图像与黑盒LM之间更好连接器的描述生成模型。与通用描述不同,PromptCap采用自然语言提示来控制生成描述中所要描述的视觉实体。该提示包含一个描述应辅助回答的问题。为避免额外标注,PromptCap通过使用GPT-3和现有数据集合成的示例进行训练。我们在已有流水线中展示了PromptCap的有效性,该流水线用图像描述提示GPT-3执行VQA。PromptCap大幅优于通用描述,并在基于知识的VQA任务上达到最先进精度(OK-VQA上60.4%,A-OKVQA上59.6%)。WebQA上的零样本结果表明PromptCap对未见过领域泛化良好。
引用
@article{arxiv.2211.09699,
title = {PromptCap: Prompt-Guided Task-Aware Image Captioning},
author = {Yushi Hu and Hang Hua and Zhengyuan Yang and Weijia Shi and Noah A Smith and Jiebo Luo},
journal= {arXiv preprint arXiv:2211.09699},
year = {2023}
}
备注
Accepted to ICCV 2023