中文

学习压缩硬尾部:可解线性模型中的训练依赖推断比例

机器学习 2026-01-08 v1 无序系统与神经网络 人工智能 机器学习

摘要

我们分析了可解线性模型中最后一层微调的神经网络比例律。在我们的潜在实例难度(LID)模型中,每个输入的目标方差由从重尾分布中抽取的潜在“精度”所支配。虽然一般化损失恢复标准比例律,但我们的主要贡献将其与推断联系起来。pass@kk 失败率呈现幂律衰减 kβeffk^{-\beta_\text{eff}},但观察到的指数 βeff\beta_\text{eff} 取决于训练过程。它随样本大小 NN 增长,随后在由难度分布尾部所决定的固有极限 β\beta 处饱和。这一耦合关系揭示了学习压缩“硬尾”:模型的一般化误差改进加深了 pass@kk 曲线,直至不可约目标方差占主导地位。LID 模型给出可测试的闭式预测,包括一种计算资源分配规则,优先在饱和前进行训练,在饱和后进行推断尝试。我们在仿真以及 CIFAR-10H(人类标签方差)和数学教师-学生蒸馏任务中验证了这些预测。

关键词

引用

@article{arxiv.2601.03764,
  title  = {Learning Shrinks the Hard Tail: Training-Dependent Inference Scaling in a Solvable Linear Model},
  author = {Noam Levi},
  journal= {arXiv preprint arXiv:2601.03764},
  year   = {2026}
}

备注

10 pages