低秩重缩放 Vision Transformer 微调:一种残差设计方法
计算机视觉与模式识别
2024-03-29 v1
摘要
预训练 Vision Transformer 的参数高效微调旨在通过学习一小组新的适配参数,同时冻结大部分预训练参数,将模型熟练地适配到下游任务。在保留预训练模型泛化表示能力与获取任务特定特征之间取得平衡是一个关键挑战。目前,缺乏对这一微妙权衡进行指导的关注。在本研究中,我们从预训练参数矩阵奇异值分解的角度探讨该问题,为现有方法的微调动态提供了深刻见解。基于这一理解,我们提出了一种基于残差的低秩重缩放微调策略。该策略不仅增强了参数微调的灵活性,还通过残差设计确保新参数不会过度偏离预训练模型。大量实验表明,我们的方法在各种下游图像分类任务中取得了具有竞争力的性能,同时保持了相当的新增参数量。我们相信这项工作在为解释现有方法提供统一视角方面迈出了一步,并激励开发能够更有效地考虑上述关键权衡的新方法。我们的代码可在 https://github.com/zstarN70/RLRR.git 获取。
引用
@article{arxiv.2403.19067,
title = {Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design Approach},
author = {Wei Dong and Xing Zhang and Bihui Chen and Dawei Yan and Zhijun Lin and Qingsen Yan and Peng Wang and Yang Yang},
journal= {arXiv preprint arXiv:2403.19067},
year = {2024}
}