中文

Coeff-Tuning:一种用于微调基于注意力的大模型的图滤波器子空间视角

计算机视觉与模式识别 2025-03-25 v1

摘要

基于Transformer的大型预训练模型展现出卓越的泛化能力,各种参数高效微调(PEFT)方法被提出来以最小的计算和内存预算在下游任务上定制这些模型。先前的PEFT方法主要从张量分解的角度设计,试图通过找到最小的可训练参数子集来有效调整线性变换。我们的研究采用了一个正交视角,将注意力操作表示为图卷积,并将多头注意力图表述为卷积滤波器子空间,每个注意力图作为子空间元素。在本文中,我们提出通过学习一组小的组合系数来调整大型预训练Transformer,这些系数从原始多头注意力图构建一个更具表达力的滤波器子空间。我们在分析和实验上表明,调整后的滤波器子空间可以有效扩展多头注意力的特征空间,并进一步增强Transformer的能力。我们进一步通过可调子空间系数的残差参数化来稳定微调,并通过在训练期间直接对可调系数应用dropout的正则化设计来增强泛化。可调系数参数数量极少,并且可以以即插即用的方式与先前的PEFT方法结合。大量实验表明,我们的方法在可忽略的额外参数下实现了优于PEFT基线的性能。

关键词

引用

@article{arxiv.2503.18337,
  title  = {Coeff-Tuning: A Graph Filter Subspace View for Tuning Attention-Based Large Models},
  author = {Zichen Miao and Wei Chen and Qiang Qiu},
  journal= {arXiv preprint arXiv:2503.18337},
  year   = {2025}
}