中文

仅大权重(而非跳连)可防止秩坍塌的危险

机器学习 2025-05-23 v1

摘要

注意力机制是现代大语言模型(LLM)的核心。对于前向和反向(梯度)计算的直观算法时间复杂度为二次,Alman 和 Song(NeurIPS 2023)以及 Alman 和 Song(NeurIPS 2024)的工作表明,除非模型权重较小,否则必须耗时二次。在这种情况下,几乎线性时间的算法可行。本文表明,大权重是避免我们称之为层坍塌的强烈限制的必要条件,这一概念意味着整个网络可仅用单个层的网络良好近似。因此,注意力的二次运行时间对有表现力的变压器是不可避免的。我们引入的层坍塌概念是 Dong、Cordonnier 以及 Loukas(ICML 2021)工作中秩坍塌概念的一种变体。他们表明,在权重较小且带有跳连的自注意力网络中,必须发生秩坍塌。这通常被解释为正式化有表现力网络中跳连必要性的理由。然而,您的结果表明,即使有跳连,若权重较小,层坍塌仍然发生。因此,只有大权重,而非跳连,才能防止这些表征缺陷。

关键词

引用

@article{arxiv.2505.16284,
  title  = {Only Large Weights (And Not Skip Connections) Can Prevent the Perils of Rank Collapse},
  author = {Josh Alman and Zhao Song},
  journal= {arXiv preprint arXiv:2505.16284},
  year   = {2025}
}