通过 Householder 变换高效适配预训练视觉 Transformer
计算机视觉与模式识别
2024-10-31 v1 人工智能
摘要
预训练视觉 Transformer(ViT)的参数高效微调(PEFT)的一种常见策略是学习一个低秩适配矩阵以适应下游任务。该矩阵被分解为下投影矩阵和上投影矩阵的乘积,其中瓶颈维度对于减少可学习参数的数量至关重要,如 LoRA 和 Adapter 等流行方法所示。然而,这些低秩策略通常采用固定的瓶颈维度,这限制了它们处理逐层变化的灵活性。为解决此限制,我们提出了一种受奇异值分解(SVD)启发的新型 PEFT 方法来表示适配矩阵。SVD 将矩阵分解为一个酉矩阵、一个对角矩阵和另一个酉矩阵的乘积。我们利用 Householder 变换来构造正交矩阵,以有效地模拟酉矩阵,仅需一个向量。对角值以逐层方式学习,使其能够灵活地捕捉每层的独特属性。这种方法能够生成在不同层具有不同秩的适配矩阵,从而在适配预训练模型时提供更大的灵活性。在标准下游视觉任务上的实验表明,我们的方法取得了有前景的微调性能。
引用
@article{arxiv.2410.22952,
title = {Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation},
author = {Wei Dong and Yuan Sun and Yiting Yang and Xing Zhang and Zhijun Lin and Qingsen Yan and Haokui Zhang and Peng Wang and Yang Yang and Hengtao Shen},
journal= {arXiv preprint arXiv:2410.22952},
year = {2024}
}