先生成后选择:由世界知识引导的开放式视觉问答
计算与语言
2023-05-31 v1 人工智能
计算机视觉与模式识别
摘要
开放式视觉问答(VQA)任务要求 AI 模型利用世界知识对视觉和自然语言输入进行联合推理。近来,诸如 GPT-3 等预训练语言模型(PLM)已被应用于该任务,并显示出作为强大世界知识源的能力。然而,这些方法受到由 PLM 偏置引起的低知识覆盖率的困扰——即无论提示如何变化都倾向于生成某些词元而非其他词元,并且高度依赖 PLM 质量——仅使用 GPT-3 的模型能取得最佳结果。为应对上述挑战,我们提出 RASO:一种新颖的 VQA 流水线,首次部署由世界知识引导的“先生成后选择”策略。RASO 不遵循训练直接生成 VQA 答案的多模态模型这一事实标准,而是首先采用 PLM 生成所有可能的答案,然后训练一个轻量级答案选择模型以选出正确答案。如我们的分析所证明,RASO 大幅扩展了来自域内训练数据的知识覆盖率。我们提供了大量实验,并表明我们的流水线在 OK-VQA 上将最先进水平提升了 4.1%,且无额外计算成本。代码和模型发布于 http://cogcomp.org/page/publication_view/1010
引用
@article{arxiv.2305.18842,
title = {Generate then Select: Open-ended Visual Question Answering Guided by World Knowledge},
author = {Xingyu Fu and Sheng Zhang and Gukyeong Kwon and Pramuditha Perera and Henghui Zhu and Yuhao Zhang and Alexander Hanbo Li and William Yang Wang and Zhiguo Wang and Vittorio Castelli and Patrick Ng and Dan Roth and Bing Xiang},
journal= {arXiv preprint arXiv:2305.18842},
year = {2023}
}
备注
Accepted to ACL 2023 Findings