中文

InRank:增量低秩学习

机器学习 2024-01-02 v2

摘要

贪心低秩学习(GLRL)理论旨在解释深度学习的卓越泛化能力。它证明基于随机梯度的训练通过训练期间秩的逐渐增加,隐式地将神经网络正则化为低秩解。然而,理论与实践之间存在差距,因为 GLRL 需要权重的无穷小初始化,而由于这是一个鞍点,该初始化并不实用。本工作中,我们通过关注累积权重更新,去除了无穷小初始化的假设。我们证明在三层线性网络中,对于任意正交权重初始化,累积权重更新遵循增量低秩轨迹。通过实验,我们证明该理论广泛适用于多种神经网络(如 transformers)和标准训练算法(如 SGD、Adam)。然而,现有训练算法并未利用低秩特性来提升计算效率,因为网络并非以低秩参数化。为弥补这一点,我们设计了一种新的训练算法——增量低秩学习(InRank),它显式地将累积权重更新表示为低秩矩阵,同时在训练期间逐步增加其秩。我们在 GPT-2 上评估 InRank,结果表明 InRank 取得了与全秩对应模型相当的预测性能,而整个训练过程中所需秩最多为其 33%。我们还提出了 InRank 的高效版本,在 WikiText-103 上从头训练 GPT-medium 时,总训练时间减少 37%,模型大小减少 36%。

关键词

引用

@article{arxiv.2306.11250,
  title  = {InRank: Incremental Low-Rank Learning},
  author = {Jiawei Zhao and Yifei Zhang and Beidi Chen and Florian Schäfer and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2306.11250},
  year   = {2024}
}