中文

DiaBlo:对角块足以进行微调

机器学习 2026-03-04 v2 人工智能 计算与语言 最优化与控制

摘要

微调是将大型语言模型(LLM)适配到特定领域下游任务的关键步骤。为了缓解全模型微调带来的大量计算和内存开销,参数高效微调(PEFT)方法被提出,仅更新模型参数的一小部分。然而,PEFT 方法与全模型微调之间仍存在性能差距。在本工作中,我们提出了 DiaBlo,一种简单而有效的 PEFT 方法,仅更新选定模型权重矩阵的对角块。与低秩适配(LoRA)及其变体不同,DiaBlo 消除了对低秩矩阵乘积的需求,从而避免了对辅助初始化方案或定制优化策略的依赖以改善收敛。这种设计带来了稳定且鲁棒的收敛,同时保持了与 LoRA 相当的内存效率和训练速度。此外,我们提供了理论保证,表明在温和的低秩条件下,DiaBlo 在线性问题中比 LoRA 更具表达能力,并且能够收敛到一般非线性全微调的驻点。通过在包括常识推理、算术推理、代码生成和安全对齐在内的多项任务上的广泛实验,我们表明仅微调对角块即可获得强大且一致的性能。DiaBlo 不仅实现了有竞争力的准确率,还保持了高内存效率和快速微调速度。代码可在 https://github.com/ziyangjoy/DiaBlo 获取。

关键词

引用

@article{arxiv.2506.03230,
  title  = {DiaBlo: Diagonal Blocks Are Sufficient For Finetuning},
  author = {Selcuk Gurses and Aozhong Zhang and Yanxia Deng and Xun Dong and Xin Li and Naigang Wang and Penghang Yin and Zi Yang},
  journal= {arXiv preprint arXiv:2506.03230},
  year   = {2026}
}

备注

Accepted by ICLR 2026