通过回收预调谐LoRA实现视觉基础模型无调参少样适应性
计算机视觉与模式识别
2024-12-04 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 如ChatGPT展示出强大的无需微调的少样适应性,使其成为数据受限和实时应用的理想选择。然而,这种适应性尚未在当前的视觉基础模型 (VFM) 中得到复制,这些模型需要足够的调谐数据进行显式微调。此外,预训练-微调范式导致大量任务特定模块的涌现,如低秩适应 (LoRA)。本文首次探讨了在不获取原始训练数据的情况下复用多样化预调谐LoRA,以实现VFM的无调参少样适应性的潜力。我们的框架LoRA Recycle通过基于预调谐LoRA自身生成的代理数据,对多样化预调谐LoRA进行元学习蒸馏,获得meta-LoRA。一旦VFM配备meta-LoRA,即可像LLM的情境学习一样在单次前向传播中解决新的少样任务。此外,我们引入了针对该框架的双高效机制,显著加速元训练过程,同时保持或甚至提升性能。广泛的实验表明,在各种少样分类基准测试的内域和跨域场景中,我们的框架均显示出优越性。
引用
@article{arxiv.2412.02220,
title = {Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs},
author = {Zixuan Hu and Yongxian Wei and Li Shen and Chun Yuan and Dacheng Tao},
journal= {arXiv preprint arXiv:2412.02220},
year = {2024}
}