中文

面向生成式预训练视觉语言模型的 p-拉普拉斯适配器

计算机视觉与模式识别 2023-12-19 v1

摘要

在大规模语料库上预训练的视觉语言模型在一系列下游任务中取得了显著成功。鉴于预训练 VLMs 的规模迅速增加,参数高效迁移学习(PETL)作为全量微调的可行替代方案受到了广泛关注。适配器便是其中一种方法,它在适应过程中向预训练模型引入少量可训练参数,同时保持原始参数不变。在本文中,我们提出了一种新颖的建模框架,将注意力之后的适配器微调重新表述为注意力图上的图消息传递过程,其中投影的查询和值特征以及注意力矩阵分别构成节点特征和图邻接矩阵。在该框架内,由于投影的查询空间与值空间之间存在差异,在 VLMs 中微调适配器需要处理异配图。为应对这一挑战,我们提出了一种新的适配器架构 pp-adapter,它在图神经网络中采用 pp-拉普拉斯消息传递。具体而言,注意力权重基于特征被重新归一化,然后使用校准后的注意力矩阵聚合特征,从而能够在异配注意力图中动态利用具有不同频率的信息。我们在不同的预训练 VLMs 和多模态任务上进行了广泛实验,包括视觉问答、视觉蕴含和图像描述。实验结果验证了我们的方法相对于其他 PETL 方法的显著优越性。

关键词

引用

@article{arxiv.2312.10613,
  title  = {p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models},
  author = {Haoyuan Wu and Xinyun Zhang and Peng Xu and Peiyu Liao and Xufeng Yao and Bei Yu},
  journal= {arXiv preprint arXiv:2312.10613},
  year   = {2023}
}

备注

Accepted by AAAI24. The first two authors contributed equally to this paper