Flexora: 大语言模型的灵活低秩适配
人工智能
2025-10-20 v5 计算与语言
摘要
大语言模型(LLM)通过增加模型参数规模推动了人工智能的进步,显著增强了泛化能力并在实践中解锁了新能力。然而,它们在下游特定任务上的性能通常受到其知识边界的限制。因此,微调技术——尤其是广泛使用的低秩适配(LoRA)方法——被引入以扩展这些任务的边界,但LoRA在某些任务上会因潜在的过拟合而表现不佳。为克服这种过拟合并提升LoRA的性能,本文提出了灵活低秩适配(Flexora)方法,以自动且灵活地选择最需要微调的最优层,从而在不同下游任务上取得最佳性能。具体而言,Flexora首先将这一层选择问题构建为一个定义良好的超参数优化(HPO)问题,然后利用展开微分(UD)方法求解,最后基于优化后的超参数选择最有用的层。我们在大量预训练模型和自然语言处理任务上的广泛实验表明,Flexora能够持续超越现有基线,证明了Flexora在实际中的有效性。此外,我们提供了深入的理论结果和大量消融实验,以全面理解Flexora。
引用
@article{arxiv.2408.10774,
title = {Flexora: Flexible Low Rank Adaptation for Large Language Models},
author = {Chenxing Wei and Yao Shu and Ying Tiffany He and Fei Richard Yu},
journal= {arXiv preprint arXiv:2408.10774},
year = {2025}
}
备注
40 pages, 15 figures