中文

OSoRA:基于输出维度与奇异值初始化的低秩适应方法

计算与语言 2025-05-22 v2

摘要

对大型语言模型(LLM)进行微调正因其规模庞大且计算成本高而日益具有挑战性。参数高效微调(PEFT)方法被提出作为计算替代方案,但其实现仍需大量资源。本文提出OSoRA(Output-Dimension and Singular-Value Initialized Low-Rank Adaptation),一种用于LLM的新型PEFT方法。OSoRA通过将奇异值分解(SVD)与可学习的缩放向量集成于统一框架中,扩展了低秩适应(LoRA)。它首先对预训练权重矩阵进行SVD,然后在训练期间优化输出维度向量,而保持相应奇异向量矩阵冻结。通过最小化微调期间可训练参数的数量,OSoRA大幅降低了计算资源需求。广泛的评估涵盖数学推理、常识推理及其他基准测试,结果表明OSoRA在性能上与LoRA、VeRA等最先进方法相当或更优,同时即使当秩提升至更高维度时,参数规模仍保持线性。我们的消融研究进一步确认,同时训练奇异值与输出维度向量是实现最佳性能的关键。

关键词

引用

@article{arxiv.2505.14350,
  title  = {OSoRA: Output-Dimension and Singular-Value Initialized Low-Rank Adaptation},
  author = {Jialong Han and Si Zhang and Ke Zhang},
  journal= {arXiv preprint arXiv:2505.14350},
  year   = {2025}
}