中文

CR-Net:基于跨层低秩结构扩展参数高效训练

机器学习 2026-05-14 v3

摘要

低秩架构对于高效的大型语言模型(LLM)预训练变得越来越重要,它在参数复杂度和内存/计算需求方面均提供了大幅降低。尽管具有这些优势,当前的低秩方法仍面临三个关键缺陷:(1) 模型性能受损,(2) 计算开销相当大,以及 (3) 激活内存节省有限。为了解决这些局限性,我们提出了跨层低秩残差网络(CR-Net),这是一种创新的参数高效框架,其灵感来自于我们发现层间激活残差具有低秩性质。CR-Net 通过双路径架构实现了这一洞察,该架构通过将前层输出与其低秩差值相结合来高效重构层激活,从而以最少的参数维持高秩信息。我们进一步开发了专为 CR-Net 量身定制的激活重计算策略,显著降低了内存需求。在 60M 到 7B 参数的模型规模上进行的广泛预训练实验表明,CR-Net 始终优于最先进的低秩框架,同时所需的计算资源更少、内存更小。

关键词

引用

@article{arxiv.2509.18993,
  title  = {CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure},
  author = {Boao Kong and Junzhu Liang and Yuxi Liu and Renjia Deng and Kun Yuan},
  journal= {arXiv preprint arXiv:2509.18993},
  year   = {2026}
}

备注

32 pages. Accepted by ICLR 2026