VL-PET:通过粒度控制的视觉与语言参数高效微调
计算机视觉与模式识别
2023-08-22 v1 人工智能
计算与语言
机器学习
摘要
随着预训练语言模型(PLMs)的模型规模迅速增长,全参数微调在模型训练与存储上变得极其昂贵。在视觉与语言(VL)领域,参数高效微调(PET)技术被提出以将模块化修改(如Adapter和LoRA)集成到编码器-解码器PLMs中。通过微调少量可训练参数,这些技术的表现与全参数微调相当。然而,过度的模块化修改以及忽视编码器与解码器之间的功能差异可能导致性能下降,而现有PET技术(如VL-Adapter)忽视了这些关键问题。本文提出一种视觉与语言参数高效微调(VL-PET)框架,通过一种新颖的粒度控制机制对模块化修改施加有效控制。考虑到该机制生成的不同粒度控制矩阵,可从我们的框架中实例化多种与模型无关的VL-PET模块,以实现更好的效率与效果权衡。我们进一步提出轻量级PET模块设计,以增强编码器的VL对齐与建模能力,并维持解码器的文本生成能力。在四个图像-文本任务和四个视频-文本任务上开展的广泛实验证明了我们VL-PET框架的高效性、有效性与可迁移性。特别地,采用轻量级PET模块设计的VL-PET-large在图像-文本任务上以BART-base(T5-base)分别显著优于VL-Adapter 2.92%(3.41%)和LoRA 3.37%(7.03%)。此外,我们验证了在现有PET技术上采用VL-PET设计所带来的增强效果,使其取得显著的性能提升。我们的代码可在 https://github.com/HenryHZY/VL-PET 获取。
引用
@article{arxiv.2308.09804,
title = {VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity Control},
author = {Zi-Yuan Hu and Yanyang Li and Michael R. Lyu and Liwei Wang},
journal= {arXiv preprint arXiv:2308.09804},
year = {2023}
}
备注
ICCV 2023 (17 pages, 6 figures, 22 tables)