中文

一种边界层机制用于在线 Softmax 分类中的三分之一比例缩放

机器学习 2026-05-22 v1 无序系统与神经网络

摘要

硬标签分类通常使用光滑的代理损失训练,最突出的是 softmax 交叉熵。我们隔离了这种光滑代理与离散标签之间的不匹配产生的幂律学习曲线的渐近机制。在减去均值 logit 后,热力学极限动力学在居中变量中闭合:一个不断增大的居中学生-教师对齐 D 以及剩余的学生方差 Δ。在晚期时间,距离教师决策边界之外的样本已经自信地被分类,贡献指数级微小。在此期间,只有宽度为 O(D^{-1}) 的边界层保持活跃,而固定学习率的在线梯度下降噪声维持着非零的 Δ。作为训练时间 α 的函数,晚期解为 test loss 也产生 α^{-1/3} 的幂律,以及 generalization error ε_g,即 1 - test accuracy。这是远远慢于相同模型下的 α^{-1} 的贝叶斯最优参考。我们进一步表明,学习率计划可以将 generalization error 提升至 ε_g ~ α^{-1/2} 的幂律。仿真结果支持预测的序参数动力学和学习曲线。受控实验使用相关高斯输入和白化预训练特征表明,数据结构可以主导瞬态。因此,本结果是一种渐近的、补充性机制,而非神经网络比例定律的谱解释的替代方案。

关键词

引用

@article{arxiv.2605.22341,
  title  = {A Boundary-Layer Mechanism for One-Third Scaling in Online Softmax Classification},
  author = {Marcel Kühn and Yoon Thelge and Bernd Rosenow},
  journal= {arXiv preprint arXiv:2605.22341},
  year   = {2026}
}

备注

20 pages, 7 figures