中文

利用语言模型反馈的零样本视觉问答

计算机视觉与模式识别 2023-05-29 v1 计算与语言

摘要

在本文中,我们提出了一种新颖的语言模型引导描述生成方法 LAMOC,用于基于知识的视觉问答(VQA)。我们的方法将描述生成模型生成的 caption 作为答案预测模型(一个预训练语言模型,PLM)的上下文。作为主要贡献,我们利用预测模型的引导和反馈来提升描述生成模型的能力。这样,描述生成模型能够感知来自 PLM 的任务目标和信息需求。为开发我们的方法,我们设计了两个特定的训练阶段:第一阶段使描述生成模型适应预测模型(选择更合适的描述命题进行训练),第二阶段根据任务目标(从 PLM 的反馈中学习)微调描述生成模型。大量实验证明了所提方法在基于知识的 VQA 任务上的有效性。具体而言,在具有挑战性的 A-OKVQA 数据集上,LAMOC 优于多种有竞争力的零样本方法,甚至取得了与微调 VLP 模型相当的结果。我们的代码公开于 https://github.com/RUCAIBox/LAMOC。

关键词

引用

@article{arxiv.2305.17006,
  title  = {Zero-shot Visual Question Answering with Language Model Feedback},
  author = {Yifan Du and Junyi Li and Tianyi Tang and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2305.17006},
  year   = {2023}
}

备注

Accepted by ACL2023 findings