中文

MetaVL:将上下文学习能力从语言模型迁移至视觉-语言模型

计算与语言 2023-06-05 v1

摘要

大规模语言模型已展现出通过以少量示例为条件(即上下文学习)来适应新任务的能力。然而,在视觉-语言领域,大多数大规模预训练视觉-语言(VL)模型不具备进行上下文学习的能力。我们如何为 VL 模型赋予上下文学习能力?本文研究了一个有趣的假设:我们能否将上下文学习能力从语言领域迁移到 VL 领域?具体而言,我们首先元训练一个语言模型以在 NLP 任务上执行上下文学习(如 MetaICL 中所示);随后通过连接视觉编码器将该模型迁移以执行 VL 任务。我们的实验表明,上下文学习能力确实可以跨模态迁移:我们的模型显著提升了在 VL 任务上的上下文学习能力,甚至可大幅弥补模型规模的不足。在 VQA、OK-VQA 与 GQA 上,我们的方法能以少 20 倍参数的规模优于基线模型。

关键词

引用

@article{arxiv.2306.01311,
  title  = {MetaVL: Transferring In-Context Learning Ability From Language Models to Vision-Language Models},
  author = {Masoud Monajatipoor and Liunian Harold Li and Mozhdeh Rouhsedaghat and Lin F. Yang and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2306.01311},
  year   = {2023}
}