中文

稀疏高秩适配器

机器学习 2025-01-28 v2 人工智能

摘要

低秩适配(LoRA)在最近的生成式人工智能研究中获得了广泛关注。LoRA 的主要优势之一是其能够与预训练模型融合,在推理过程中不增加额外开销。然而,从移动端部署的角度来看,我们要么避免融合模式下的推理开销,但失去快速切换适配器的能力;要么在非融合模式下实现快速切换,但承受显著(高达 30%)更高的推理延迟。当多个适配器同时使用时,LoRA 还表现出概念丢失。在本文中,我们提出了稀疏高秩适配器(SHiRA),这是一种新范式,它不产生推理开销,支持快速切换,并显著减少概念丢失。具体来说,SHiRA 可以通过直接仅微调基础模型权重的 1-2% 而保持其他权重不变来训练。这产生了一个高度稀疏的适配器,可以直接在融合模式下切换。我们进一步提供了理论和实证见解,说明 SHiRA 中的高稀疏性如何通过减少概念丢失来辅助多适配器融合。我们在 LVM 和 LLM 上的大量实验表明,仅微调基础模型中一小部分参数在性能上显著优于 LoRA,同时实现了快速切换和多适配器融合。最后,我们基于参数高效微调(PEFT)库提供了一个延迟和内存高效的 SHiRA 实现,其训练速度几乎与 LoRA 相同,同时峰值 GPU 内存消耗降低高达 16%,从而使 SHiRA 易于在实际用例中采用。为了展示推理过程中快速切换的优势,我们展示了在基础模型上加载 SHiRA 比在 CPU 上进行 LoRA 融合快 5 到 16 倍。

关键词

引用

@article{arxiv.2406.13175,
  title  = {Sparse High Rank Adapters},
  author = {Kartikeya Bhardwaj and Nilesh Prasad Pandey and Sweta Priyadarshi and Viswanath Ganapathy and Shreya Kadambi and Rafael Esteves and Shubhankar Borse and Paul Whatmough and Risheek Garrepalli and Mart Van Baalen and Harris Teague and Markus Nagel},
  journal= {arXiv preprint arXiv:2406.13175},
  year   = {2025}
}

备注

NeurIPS 2024