中文

利用预训练基础模型无需进一步训练解决视觉问答

计算机视觉与模式识别 2023-09-28 v1

摘要

大语言模型(LLMs)已在许多自然语言处理任务中取得最先进的结果。它们还展示了通过零样本或少样本设置良好适应不同任务的能力。借助这些 LLM 的能力,研究人员已探索如何将其用于视觉问答(VQA)。许多方法需要进一步训练以对齐图像和文本嵌入。然而,这些方法计算开销大,且需要大规模图像-文本数据集进行训练。在本文中,我们探索了一种结合预训练 LLM 与其他基础模型且无需进一步训练以解决 VQA 问题的方法。总体思路是用自然语言表示图像,使 LLM 能够理解图像。我们探索了用于生成图像文本表示的不同解码策略,并在 VQAv2 数据集上评估了它们的性能。

关键词

引用

@article{arxiv.2309.15487,
  title  = {Tackling VQA with Pretrained Foundation Models without Further Training},
  author = {Alvin De Jun Tan and Bingquan Shen},
  journal= {arXiv preprint arXiv:2309.15487},
  year   = {2023}
}