中文

基于冻结 LLM 的少样本 VQA:两种方法的故事

计算与语言 2024-03-19 v1 计算机视觉与模式识别

摘要

目前出现了两种将图像输入大型语言模型的方法。第一种是将图像描述为自然语言。第二种是将图像特征嵌入映射到 LLM 的域中,并将映射后的嵌入直接传递给 LLM。最近的大多少样本多模态工作报告了使用这两种方法之一的变体架构的性能。但它们忽略了这两者之间的重要比较。我们设计了一个受控且集中的实验,以比较这两种使用 LLM 进行少样本视觉问答(VQA)的方法。我们的发现表明,对于 3B 参数的 LLM Flan-T5 XL,将视觉嵌入直接连接到 LLM 嵌入空间并不能保证比使用图像描述获得更好的性能。在零样本机制下,我们发现使用文本图像描述更好。在少样本机制下,上下文示例的选择方式决定了哪种方法更好。

关键词

引用

@article{arxiv.2403.11317,
  title  = {Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches},
  author = {Igor Sterner and Weizhe Lin and Jinghong Chen and Bill Byrne},
  journal= {arXiv preprint arXiv:2403.11317},
  year   = {2024}
}