GPT-3 用于少样本基于知识的视觉问答的实证研究
计算机视觉与模式识别
2022-09-15 v2
摘要
基于知识的视觉问答(VQA)涉及回答需要图像中不存在的外部知识的问题。现有方法首先从外部资源检索知识,然后基于所选知识、输入图像和问题进行推理以预测答案。然而,这种两步方法可能导致错配,潜在地限制 VQA 性能。例如,检索的知识可能含有噪声且与问题无关,并且推理过程中重新嵌入的知识特征可能偏离其在知识库(KB)中的原意。为应对这一挑战,我们提出 PICa,一种简单而有效的方法,通过利用图像描述来提示 GPT-3,用于基于知识的 VQA。受 GPT-3 在知识检索与问答方面能力的启发,与以往工作使用结构化 KB 不同,我们将 GPT-3 视为可联合获取并处理相关知识的隐式非结构化 KB。具体而言,我们首先将图像转换为 GPT-3 可理解的描述(或标签),然后通过仅提供少量上下文内 VQA 示例,使 GPT-3 以适应少样本方式解决 VQA 任务。我们通过仔细研究以下方面进一步提升性能:(i)何种文本格式最能描述图像内容,以及(ii)上下文内示例如何被更好地选择与使用。PICa 开启了 GPT-3 用于多模态任务的首次使用。仅使用 16 个示例,PICa 在 OK-VQA 数据集上以绝对 +8.6 分超越有监督的最先进方法。我们还在 VQAv2 上对 PICa 进行基准测试,其中 PICa 同样展现出不错的少样本性能。
引用
@article{arxiv.2109.05014,
title = {An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA},
author = {Zhengyuan Yang and Zhe Gan and Jianfeng Wang and Xiaowei Hu and Yumao Lu and Zicheng Liu and Lijuan Wang},
journal= {arXiv preprint arXiv:2109.05014},
year = {2022}
}
备注
AAAI 2022 (Oral Presentation)