WeGeFT:面向大模型多维度高效适配的权重生成式微调
计算机视觉与模式识别
2025-07-15 v5 机器学习
摘要
微调大型预训练 Transformer 模型可以侧重于引入少量新的可学习参数(参数效率),或使用轻量级模块编辑少量 token 的表示(表示效率)。尽管开创性方法 LoRA(Low-Rank Adaptation,低秩适配)本质上平衡了参数、计算和内存效率,但许多后续变体为了进一步减少微调参数,牺牲了计算和内存效率及/或性能。为解决这一局限并统一参数高效与表示高效的微调,我们提出 Weight-Generative Fine-Tuning(WeGeFT,读作 wee-gift,权重生成式微调),一种新颖的方法,学习直接从预训练权重生成微调权重。WeGeFT 采用由两层线性层组成的简单低秩形式,既可在预训练模型的多个层间共享,也可为不同层单独学习。该设计在参数、表示、计算和内存上实现了多维度效率,同时保持或超越了 LoRA 及其变体的性能。在常识推理、算术推理、指令遵循、代码生成和视觉识别上的大量实验验证了我们所提 WeGeFT 的有效性。我们的代码可在 https://github.com/savadikarc/wegeft 获取。
引用
@article{arxiv.2312.00700,
title = {WeGeFT: Weight-Generative Fine-Tuning for Multi-Faceted Efficient Adaptation of Large Models},
author = {Chinmay Savadikar and Xi Song and Tianfu Wu},
journal= {arXiv preprint arXiv:2312.00700},
year = {2025}
}
备注
Accepted to ICML25