中文

GQA-{\mu}P:分组查询注意力的最大参数化更新

机器学习 2026-05-18 v1 人工智能

摘要

跨模型架构的超参数迁移显著降低了对大型语言模型(LLM)调参计算量。最大化更新参数化({\mu}P)通过原则性数学分析确保迁移效果,但对新模型架构推导较为困难。基于Yang等人(2023a)的谱特征学习视角,我们提出了两项改进。第一项,我们将权重的谱范数条件从经验方法提升为特征学习的定义,因此无需依赖懒惰学习即可得出Complete-P深度和权重衰减比例尺。第二项,我们考虑修改后的谱范数,以在权重矩阵非满秩时保持网络权重的有效比例尺。这使我们能够(据我们所知,首次)为分组查询注意力(GQA)推导{\mu}P比例尺。我们通过展示在GQA重复参数超参数上实现学习率迁移以及权重衰减迁移实验,证明了理论推导的有效性。

关键词

引用

@article{arxiv.2605.15290,
  title  = {GQA-{\mu}P: The maximal parameterization update for grouped query attention},
  author = {Kyle R. Chickering and Huijuan Wang and Mengxi Wu and Alexander Moreno and Muhao Chen and Xuezhe Ma and Daria Soboleva and Joel Hestness and Zhengzhong Liu and Eric Xing},
  journal= {arXiv preprint arXiv:2605.15290},
  year   = {2026}
}

备注

18 pages