中文

基于近似正交微调策略的预训练视觉 Transformer 高效适配

计算机视觉与模式识别 2025-07-18 v1 人工智能

摘要

预训练视觉 Transformer(ViT)的参数高效微调(PEFT)的常见方法是冻结主干参数的大部分内容,仅学习低秩适应权重矩阵以适应下游任务。这些低秩矩阵通常通过下投影和上投影矩阵的乘法结构导出,示例方法包括 LoRA 和 Adapter。在本工作中,我们注意到,预训练主干参数中任意两个行或列向量之间存在近似正交性;然而,这一性质在下/上投影矩阵中不存在。近似正交性意味着模型泛化误差上界的降低,表明模型具备增强的泛化能力。如果下/上投影矩阵在微调后也具备与主干相同的性质,是否可以进一步增强微调后 ViT 的泛化能力?为回答此问题,我们提出一种近似正交微调(AOFT)策略用于表示低秩权重矩阵。该策略采用单个可学习向量生成一组近似正交向量,作为下/上投影矩阵,从而将这些矩阵的性质与主干一致。大量实验结果表明,我们的方法在各种下游图像分类任务上实现了具竞争力的性能,确认了增强泛化能力在下/上投影矩阵中所体现的有效性。

关键词

引用

@article{arxiv.2507.13260,
  title  = {Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy},
  author = {Yiting Yang and Hao Luo and Yuan Sun and Qingsen Yan and Haokui Zhang and Wei Dong and Guoqing Wang and Peng Wang and Yang Yang and Hengtao Shen},
  journal= {arXiv preprint arXiv:2507.13260},
  year   = {2025}
}

备注

This paper is accepted by ICCV 2025