中文

MAGMA——基于适配器微调的生成模型多模态增强

计算机视觉与模式识别 2022-10-26 v2 计算与语言

摘要

大规模预训练正迅速成为视觉-语言(VL)建模的常态。然而,主流 VL 方法受限于对标注数据的需求以及复杂多步预训练目标的使用。我们提出 MAGMA——一种利用基于适配器的微调为生成式语言模型增强额外模态的简单方法。基于 Frozen,我们训练了一系列 VL 模型,可从任意视觉与文本输入组合自回归地生成文本。预训练完全端到端,使用单一语言建模目标,相较先前方法简化了优化。重要的是,语言模型权重在训练中保持不变,从而允许从语言预训练中迁移百科知识与上下文学习能力。MAGMA 在开放式生成任务上优于 Frozen,在 OKVQA 基准上取得最先进结果,并在一系列其他流行 VL 基准上取得有竞争力的结果,而其预训练所用样本数仅为训练 SimVLM 所用样本数的 0.2%。

关键词

引用

@article{arxiv.2112.05253,
  title  = {MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning},
  author = {Constantin Eichenberg and Sidney Black and Samuel Weinbach and Letitia Parcalabescu and Anette Frank},
  journal= {arXiv preprint arXiv:2112.05253},
  year   = {2022}
}

备注

13 pages, 6 figures, 2 tables. Minor improvements. Accepted at EMNLP 2022