中文

MAPL:面向视觉-语言少样本提示的单模态预训练模型参数高效适配方法

计算机视觉与模式识别 2023-03-16 v2 人工智能 计算与语言 机器学习

摘要

大型预训练模型已在单模态视觉和语言任务中被证明是卓越的零样本和(基于提示的)少样本学习器。我们提出 MAPL,一种简单且参数高效的方法,它复用冻结的单模态预训练模型,并在多模态视觉-语言(VL)设置中利用其强大的泛化能力。MAPL 使用对齐的图像-文本数据学习单模态模型表征空间之间的轻量级映射,并能从仅少量上下文示例中泛化到未见过的 VL 任务。可训练参数数量少使得 MAPL 在低数据和域内学习中表现有效。此外,MAPL 的模块化使其易于扩展到其他预训练模型。在多个视觉问答和图像描述基准上的大量实验表明,MAPL 在训练参数量少几个数量级的情况下,取得了优于或可与同类方法竞争的性能。MAPL 仅需少量计算资源和公共数据集,便可在几小时内完成训练。我们在 https://github.com/mair-lab/mapl 发布了代码和预训练模型权重。

关键词

引用

@article{arxiv.2210.07179,
  title  = {MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting},
  author = {Oscar Mañas and Pau Rodriguez and Saba Ahmadi and Aida Nematzadeh and Yash Goyal and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2210.07179},
  year   = {2023}
}

备注

Accepted at EACL 2023 (main track); 26 pages, 21 figures, 6 tables; Pau Rodriguez and Saba Ahmadi had equal contributions