通过频率化适应增强视觉Transformer的参数高效微调
计算机视觉与模式识别
2024-12-02 v1 机器学习
摘要
通过参数高效微调(PEFT)方法适配视觉Transformer基础模型已变得越来越流行。这些方法优化了有限的子集参数,使我们能够在无需对整个模型进行微调的情况下实现竞争的性能。然而,传统的PEFT方法可能限制模型捕获复杂模式的能力,尤其是与高频谱相关的模式。当然,现有研究表明,高频特征对于区分细微图像结构至关重要。为了解决这个问题,我们引入FreqFit——一个位于ViT块之间的 novel Frequency Fine-tuning模块,以增强模型的可适应性。FreqFit简单而有效,可以与所有现有的PEFT方法集成以提升其性能。通过在频率域操作特征,我们的方法允许模型更有效地捕获细微模式。针对24个数据集上的大量实验,使用各种最先进的PEFT方法,结果表明FreqFit始终优于原始PEFT方法,性能提升幅度为1%至16%。例如,FreqFit-LoRA在CIFAR100上的性能超过了state-of-the-art基线超过10%,且无需正则化或强数据增强。为可重复性,源代码地址为https://github.com/tsly123/FreqFiT。
引用
@article{arxiv.2411.19297,
title = {Enhancing Parameter-Efficient Fine-Tuning of Vision Transformers through Frequency-Based Adaptation},
author = {Son Thai Ly and Hien V. Nguyen},
journal= {arXiv preprint arXiv:2411.19297},
year = {2024}
}
备注
24 pages