中文

Transformer 中的参数分配

机器学习 2025-10-07 v1 机器学习

摘要

Transformer 已在广泛的应用领域取得显著成功,但其模型效率的理论基础仍未得到充分探索。本文我们研究在如何在层之间分配模型参数——主要是注意力头和头维度——以平衡表达性和效率的问题。我们首先从近似角度提供了关于早期层在信息提取中作用的数学分析,并对在固定参数预算下注意力头数与头维度之间的权衡进行了理论表征。此外,我们发现并证明了 softmax 激活函数的“饱和”行为:连续增加头维度对学习误差的减少会呈现递减报酬,尤其是对于长序列而言。有理论和实验的支持,表明这种饱和模式表明后期层可以以更少的参数 operating 效率更高。结合这些见解,我们提出了在 Transformer 的层之间分配注意力头和维度的原则性策略,为 Transformer-based 架构提供了理论上基于原理的模型效率分析。

关键词

引用

@article{arxiv.2510.03784,
  title  = {Allocation of Parameters in Transformers},
  author = {Ruoxi Yu and Haotian Jiang and Jingpu Cheng and Penghao Yu and Qianxiao Li and Zhong Li},
  journal= {arXiv preprint arXiv:2510.03784},
  year   = {2025}
}