中文

探究 ReLoRA:对小语言模型学习动态的影响

计算与语言 2025-10-03 v2 人工智能

摘要

像 LoRA 这样的参数高效方法已经彻底改变了大型语言模型(LLM)的微调。ReLoRA 通过反复合并和重新初始化低秩适配器,将这一思想扩展到预训练,在保持更新成本低廉的同时增加了累积秩。这与高容量模型通过随时间扩展的局部低秩轨迹进行学习的观察结果非常吻合。相比之下,近期研究表明,小语言模型(SLM)表现出秩不足,并且未能充分利用其可用维度。这引出了一个自然的问题:ReLoRA 的秩扩展更新规则能否引导 SLM 走向更健康的学习动态,从而在容量受限的情况下缓解秩瓶颈?我们认为 SLM 是一个理想的测试平台:它们训练速度快,能够进行受控消融实验,并使秩现象更易于测量。我们首次对 SLM(11M-66M 参数)中的 ReLoRA 进行了系统研究,评估了其性能和学习动态。在损失、Paloma 困惑度和 BLiMP 指标上,我们发现 ReLoRA 的表现不如全秩训练,且差距在更大规模下扩大。对比例有效秩和条件数的分析表明,ReLoRA 放大了现有的秩缺陷,并在训练早期导致了病态更新。我们的结果表明,虽然 ReLoRA 的合并与重启策略可以在更大模型中扩展秩,但它并不能直接迁移到容量有限的 SLM 上,这为低计算量预训练中的自适应秩或混合秩方法提供了动力。

关键词

引用

@article{arxiv.2509.12960,
  title  = {Investigating ReLoRA: Effects on the Learning Dynamics of Small Language Models},
  author = {Yuval Weiss and David Demitri Africa and Paula Buttery and Richard Diehl Martinez},
  journal= {arXiv preprint arXiv:2509.12960},
  year   = {2025}
}

备注

12 Pages, 6 Tables, 8 Figures