中文

UniAdapter:面向跨模态建模的统一参数高效迁移学习

计算机视觉与模式识别 2023-05-23 v2 计算与语言

摘要

大规模视觉-语言预训练模型已展现出向各类下游任务的可迁移潜力。随着这些基础模型规模与下游任务数量的增长,标准全微调范式因沉重的计算与存储成本而变得不可持续。本文提出UniAdapter,其统一了单模态与多模态适配器,用于预训练视觉-语言模型上的参数高效跨模态适配。具体而言,适配器被分布到不同模态及其交互上,并通过部分权重共享减少可训练参数总量。这种统一且知识共享的设计实现了强大的跨模态表征,可惠及各类下游任务,仅需预训练模型1.0%-2.0%的可训练参数。在6个跨模态下游基准(包括视频-文本检索、图像-文本检索、VideoQA和VQA)上的大量实验表明,在大多数情况下,UniAdapter不仅优于SOTA,甚至击败了全微调策略。特别是在MSRVTT检索任务上,UniAdapter以2.2%的模型参数实现了49.7%的recall@1,比最新竞争对手高出2.0%。代码与模型见 https://github.com/RERV/UniAdapter。

关键词

引用

@article{arxiv.2302.06605,
  title  = {UniAdapter: Unified Parameter-Efficient Transfer Learning for Cross-modal Modeling},
  author = {Haoyu Lu and Yuqi Huo and Guoxing Yang and Zhiwu Lu and Wei Zhan and Masayoshi Tomizuka and Mingyu Ding},
  journal= {arXiv preprint arXiv:2302.06605},
  year   = {2023}
}