中文

基于对数对齐比率(Log-Alignment Ratio)的训练时间诊断用于判断模型泛化能力

机器学习 2026-05-29 v1

摘要

我们研究了参数-激活对齐度的度量——对数对齐比率(LAR),该度量在参数化理论中被引入。我们将其重新表述为权谱 pp(规范化平方奇异值谱)与激活谱 qq(规范化输入在其奇异方向上的投影)之间的重叠。我们展示,LAR 的反演跟踪了记忆与泛化之间在两种不同设置下的过渡,通过捕捉训练期间 ppqq 的扩散。在“grokking”现象中,LAR 预测所学函数的有效维度:kn2(1LAR)k \approx n^{2(1-\text{LAR})},其中 nn 为矩阵的输入维数。在 3B 参数语言模型预训练中,其与非过拟合基准的偏离跟踪泛化间隙,其下降率随过拟合程度增加而加快。LAR 可从前向传播期间可用的数值计算得出,计算开销极小,且无需验证集。

关键词

引用

@article{arxiv.2605.28975,
  title  = {A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio},
  author = {Ali Shehper and Ashish Vaswani},
  journal= {arXiv preprint arXiv:2605.28975},
  year   = {2026}
}

备注

32 pages, 25 figures