中文

HD-PiSSA:高秩分布正交适配

机器学习 2025-09-29 v3 人工智能

摘要

现有的大型语言模型(LLM)参数高效微调(PEFT)方法,如 LoRA 和 PiSSA,限制模型更新在低秩子空间内,从而限制了其表达能力,导致在复杂任务上表现次佳。为此,我们引入 High-rank Distributed PiSSA(HD-PiSSA),一种分布式 PEFT 方法,该方法在不同设备上初始化正交适配器,并在 W 上聚合其 delta 更新以进行微调。不同于 Data Parallel LoRA 或 PiSSA 维持所有设备上相同适配器的方式,HD-PiSSA 为每个 GPU 分配不同的预训练权重的主成分,显著扩大了更新方向的范围。当在 8 块 GPU 上以相同每设备适配器秩进行微调时,HD-PiSSA 的有效更新秩比 Data Parallel LoRA 或 PiSSA 高出 16 倍。我们在各种具有挑战性的下游任务上进行了经验评估,包括数学、代码生成和多任务学习。在多任务设置下,HD-PiSSA 在 12 个基准上相较于 LoRA 获得平均提升 10.0 分(14.63%),相较于 PiSSA 获得 4.98 分(6.60%),展示了其来自额外优化灵活性的优势。

关键词

引用

@article{arxiv.2505.18777,
  title  = {HD-PiSSA: High-Rank Distributed Orthogonal Adaptation},
  author = {Yiding Wang and Fauxu Meng and Xuefeng Zhang and Fan Jiang and Pingzhi Tang and Muhan Zhang},
  journal= {arXiv preprint arXiv:2505.18777},
  year   = {2025}
}