中文

BLIP-2:利用冻结图像编码器与大型语言模型引导语言-图像预训练

计算机视觉与模式识别 2023-06-16 v3

摘要

由于大规模模型的端到端训练,视觉与语言预训练的成本已变得日益高昂。本文提出 BLIP-2,一种通用且高效的预训练策略,它利用现成的冻结预训练图像编码器和冻结大型语言模型来引导视觉-语言预训练。BLIP-2 通过一个轻量的 Querying Transformer 弥合模态鸿沟,该 Transformer 分两个阶段预训练。第一阶段从冻结图像编码器引导视觉-语言表征学习。第二阶段从冻结语言模型引导视觉到语言的生成式学习。尽管可训练参数显著少于现有方法,BLIP-2 在各种视觉-语言任务上取得了最先进的性能。例如,我们的模型以少 54 倍的可训练参数在零样本 VQAv2 上超越 Flamingo80B 达 8.7%。我们还展示了模型零样本图像到文本生成的涌现能力,能够遵循自然语言指令。

关键词

引用

@article{arxiv.2301.12597,
  title  = {BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models},
  author = {Junnan Li and Dongxu Li and Silvio Savarese and Steven Hoi},
  journal= {arXiv preprint arXiv:2301.12597},
  year   = {2023}
}