单向连接:变换器的参数高效微调技术
机器学习
2025-07-22 v1 人工智能
计算与语言
摘要
参数高效微调(PEFT)是一种灵活且可扩展的用于为大型语言模型(LLM)适配新任务的方法。最突出的PEFT方法之一是低秩适应(LoRA),其主要侧重于调整生成式预训练变换器(GPT2)单个解码器块中的注意力权矩阵。相比之下,我们引入了 Solo Connection,这是一种一种在解码器块级别而非修改 individual 权矩阵的方法。 Solo Connection 不仅在端到端自然语言生成基准测试中超越LoRA,还将可训练参数数量相较于LoRA降低59%,相较于GPT2全参数微调(这是一种早期大型语言模型)降低超过99%。 Solo Connection 也受到同伦理论的启发:我们引入一种可训练的线性变换,逐渐插值于零向量和 task-specific 表示之间,实现对时间的平滑稳定适应。虽然原始12层GPT2的跳过连接通常局限于单个解码器块,但后续GPT2变体扩展至48层,甚至更大的语言模型可包含128个以上的解码器块。这些扩大的架构凸显了在微调期间重新审视跳过连接的运用方式的必要性。本文聚焦于连接不同解码器块输出的长跳过连接,可能增强模型适应新任务的能力,同时利用预训练知识。
引用
@article{arxiv.2507.14353,
title = {Solo Connection: A Parameter Efficient Fine-Tuning Technique for Transformers},
author = {Harsh Nilesh Pathak and Randy Paffenroth},
journal= {arXiv preprint arXiv:2507.14353},
year = {2025}
}