LoRA-PAR:面向高效 LLM 微调的灵活双系统LoRA分区方法
机器学习
2025-09-17 v3 计算与语言
摘要
大型生成模型如DeepSeek-R1和OpenAI-O1从链式思维(CoT)推理中获益显著,但推动其性能通常需要大量数据、大型模型规模和全参数微调。虽然参数高效微调(PEFT)有助于降低成本,但大多数现有方法主要针对领域适应或层级分配,而非明确针对不同响应需求对数据和参数进行针对性设计。灵感来源于《思考,快与慢》,该书刻画了两种不同的思考模式——系统1(快速、直观、常为自动)和系统2(较慢、更深思熟虑和分析),我们将不同 LLM 参数子区域可能类似地专门用于快速直观响应或需要多步骤逻辑推理的任务。因此,我们提出了LoRA-PAR,这是一种双系统LoRA框架,通过系统1或系统2需求对数据和参数进行分区,使用更少但更聚焦的参数来处理每个任务。具体而言,我们通过多模型角色扮演和投票来分类任务数据,并基于重要性评分对参数进行分区,然后采用两阶段微调策略:先对系统1任务进行监督微调(SFT)以增强知识和直觉,再对系统2任务进行强化学习(RL)以强化更深入的逻辑推理。广泛的实验表明,两阶段微调策略(SFT和RL)降低了活跃参数使用,同时匹配或超越了SOTA PEFT基线。
引用
@article{arxiv.2507.20999,
title = {LoRA-PAR: A Flexible Dual-System LoRA Partitioning Approach to Efficient LLM Fine-Tuning},
author = {Yining Huang and Bin Li and Keke Tang and Meilian Chen},
journal= {arXiv preprint arXiv:2507.20999},
year = {2025}
}
备注
12 pages