PaCA:用于高效微调的部分连接自适应
机器学习
2025-03-12 v2 人工智能
摘要
先前的参数高效微调(PEFT)算法通过仅训练少量额外的适配器参数而非整个模型,减少了微调大型神经网络模型的内存使用和计算成本。然而,PEFT 带来的计算成本降低并不一定转化为训练时间的减少;尽管适配器层的计算成本远小于预训练层,但众所周知,这两类层在 GPU 上是顺序处理的,从而导致显著的延迟开销。LoRA 及其变体在推理期间将低秩适配器矩阵与预训练权重合并以避免延迟开销,但在训练期间,预训练权重保持冻结而适配器矩阵持续更新,使得这种合并无法实现。为缓解此问题,我们提出了部分连接自适应,它微调预训练权重中随机选择的部分连接,而不是在模型中引入适配器层。PaCA 不仅通过消除适配器层与预训练层顺序处理带来的时间开销提升了训练速度,还因为仅需存储部分激活值而非全部激活值用于梯度计算,从而减少了激活内存。与 LoRA 相比,PaCA 在各种微调场景下(如在 MMLU 数据集上微调和在 Oasst1 数据集上进行指令微调)保持相当准确率的同时,将训练时间减少了 22%,总内存使用量减少了 16%。PaCA 还可以与量化相结合,实现对 LLaMA3.1-70B 等大模型的微调。此外,与 LoRA 相比,PaCA 支持长 23% 的序列训练,并在 NVIDIA A100 GPU 和 INTEL Gaudi2 HPU 上均将吞吐量提升了 16%。代码可在 https://github.com/WooSunghyeon/paca 获取。
引用
@article{arxiv.2503.01905,
title = {PaCA: Partial Connection Adaptation for Efficient Fine-Tuning},
author = {Sunghyeon Woo and Sol Namkung and Sunwoo Lee and Inho Jeong and Beomseok Kim and Dongsuk Jeon},
journal= {arXiv preprint arXiv:2503.01905},
year = {2025}
}