基于组成性子空间表示微调的自适应大型语言模型
计算与语言
2025-04-29 v3 人工智能
摘要
适应大型语言模型以处理多个任务会导致跨技能干扰,即一个技能的改进可能损害另一个技能的性能。虽然 LoRA 等方法在权重层面施加正交约束,但未能完全解决隐藏状态表示中的干扰。我们提出了组成性子空间表示微调(CS-ReFT),这是一种基于表示的方法,通过学习多个正交子空间转换,每个子空间专注于特定技能,并通过轻量级路由器进行组合。通过在隐藏状态中隔离这些子空间编辑,而非权重矩阵,CS-ReFT 能更有效地防止跨任务冲突。在 AlpacaEval 基准测试上,针对 Llama-2-7B 应用 CS-ReFT 可实现 93.94% 的胜率,超过 GPT-3.5 Turbo(86.30%),且仅需 0.0098% 的模型参数。这些发现表明,采用简单路由器组合的专用表示编辑,能以极低的开销显著提升多任务指令遵循能力。
引用
@article{arxiv.2503.10617,
title = {Compositional Subspace Representation Fine-tuning for Adaptive Large Language Models},
author = {Andy Zhou},
journal= {arXiv preprint arXiv:2503.10617},
year = {2025}
}
备注
Accepted to ICLR 2025 SCOPE