中文

相同架构、不同容量:优化器诱导的谱比例定律

机器学习 2026-05-22 v1

摘要

比例定律使语言模型性能可预测,基于模型规模、数据和计算量,通常将优化器视为固定的训练细节。我们表明,这一假设忽略了表示比例的基本轴:优化器将添加的FFN宽度转化为实际利用的谱容量的效率。通过测量前馈网络表示的特征谱(通过软硬谱秩),我们发现\emph{相同的Transformer架构在不同优化器下实现了显著不同的谱比例定律}。在保持架构和宽度计划不变的情况下,AdamW在稀有token(TAIL)表示上表现出较弱的硬秩比例(β\beta=0.44),而Muon在相同情境下实现线性比例(β\beta=1.02),为2.3×2.3\times的比例提升。这种差异不可归因于验证损失:AdamW配置可在延长训练下匹配低秩Dion变体的困惑度,同时表现出明显不同的谱结构,表明匹配损失不等于匹配表示结构。硬--软秩不对称进一步揭示,优化器不仅在实际容量化多少方面存在差异,还在该容量如何结构化 across 特征模式方面存在差异。为消除优化器效应与架构效应的混淆,我们对比了架构干预(如注意力秩和位置编码),发现优化器诱导的谱迁移常常超过架构效应。这些结果表明优化器是表示比例的首要轴,激励优化器--架构协同设计。

关键词

引用

@article{arxiv.2605.21803,
  title  = {Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws},
  author = {Nandan Kumar Jha and Brandon Reagen},
  journal= {arXiv preprint arXiv:2605.21803},
  year   = {2026}
}

备注

31 pages, 10 figures, 30 tables. Project page: https://optimizer-scaling-laws.github.io