中文

Transformer 层的多样性:参数缩放定律的一个方面

计算与语言 2025-06-10 v2 人工智能 机器学习

摘要

Transformers 在广泛的任务中表现出色,现在是大语言模型(LLMs)的主导骨干架构。正如最近关于参数缩放定律的研究所示,通过增加参数量可以提升其任务求解性能。尽管最近的机制可解释性研究通过分析 Transformers 的残差流加深了我们对其内部行为的理解,但这些内部机制与参数缩放定律之间的关系仍不清楚。为了弥合这一差距,我们关注层及其大小,它们主要决定了 Transformers 的参数量。为此,我们首先通过偏差-多样性分解在理论上研究残差流内的层。该分解将(i)偏差(即每层输出与真实值之间的误差)和(ii)多样性(即每层输出彼此之间的差异程度)分离开来。在此理论下分析 Transformers 表明,当各层做出接近正确答案的预测并保持相互多样性时,性能会得到提升。我们表明,当各层的输出远离真实值时,多样性变得尤为关键。最后,我们引入了信息论多样性,并展示了我们的主要发现:添加层只有在这些层表现不同(即具有多样性)时才能提升性能。我们还揭示了增加层数带来的性能提升表现出次模性:随着额外层数的增加,边际改进递减,这反映了参数缩放定律预测的对数收敛。在多个语义理解任务上使用各种 LLMs 进行的实验从经验上证实了本研究中推导的理论性质。

关键词

引用

@article{arxiv.2505.24009,
  title  = {Diversity of Transformer Layers: One Aspect of Parameter Scaling Laws},
  author = {Hidetaka Kamigaito and Ying Zhang and Jingun Kwon and Katsuhiko Hayashi and Manabu Okumura and Taro Watanabe},
  journal= {arXiv preprint arXiv:2505.24009},
  year   = {2025}
}