中文

PELA:基于低秩近似学习参数高效模型

计算机视觉与模式识别 2023-11-21 v2

摘要

在资源受限条件下,将预训练大模型应用于下游任务代价高昂。近期解决效率问题的主流方法是在固定的骨干模型上添加少量可学习参数。然而,该策略在有限资源下进行下游微调时,加载大模型带来了更多挑战。本文提出一种通过引入中间预训练阶段来提高预训练模型参数效率的新方法。为此,我们首先采用低秩近似压缩原始大模型,然后设计特征蒸馏模块与权重扰动正则化模块。这些模块专为增强低秩模型而设计。特别地,我们在预训练期间仅更新低秩模型,同时冻结骨干参数。这使得低秩模型可直接高效地用于下游微调任务。所提方法在所需参数和计算时间上均实现效率提升,同时对骨干架构做最小改动并保持可比结果。具体而言,当应用于三个仅视觉和一个视觉-语言Transformer模型时,我们的方法通常仅表现出约0.6点的性能下降,同时将原始参数规模缩减1/3至2/3。

关键词

引用

@article{arxiv.2310.10700,
  title  = {PELA: Learning Parameter-Efficient Models with Low-Rank Approximation},
  author = {Yangyang Guo and Guangzhi Wang and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2310.10700},
  year   = {2023}
}