中文

面向生成式视觉问答的多模态提示检索

计算机视觉与模式识别 2023-07-03 v1 人工智能

摘要

近年来,预训练的视觉-语言模型在视觉问答(VQA)等知识密集型任务上取得了令人瞩目的结果。尽管 VQA 近期有所进展,现有方法主要采用判别式框架,在预定义标签集内预测答案,导致在标注数据有限的低资源领域(如医学)容易过拟合,且在迁移至另一数据集时泛化能力差。为应对该局限,我们提出一种由多模态提示检索(MPR)增强的新型生成式模型,其整合检索到的提示与多模态特征以自由文本生成答案。我们的生成式模型实现了对未见数据分布和跨数据集开放集答案标签的快速零样本数据集适配。我们在医学 VQA 任务上的实验表明,在少样本领域适配设定下,MPR 比无检索对应模型准确率高出至多 30 个百分点。

关键词

引用

@article{arxiv.2306.17675,
  title  = {Multimodal Prompt Retrieval for Generative Visual Question Answering},
  author = {Timothy Ossowski and Junjie Hu},
  journal= {arXiv preprint arXiv:2306.17675},
  year   = {2023}
}