学习压缩硬尾部:可解线性模型中的训练依赖推断比例
机器学习
2026-01-08 v1 无序系统与神经网络
人工智能
机器学习
摘要
我们分析了可解线性模型中最后一层微调的神经网络比例律。在我们的潜在实例难度(LID)模型中,每个输入的目标方差由从重尾分布中抽取的潜在“精度”所支配。虽然一般化损失恢复标准比例律,但我们的主要贡献将其与推断联系起来。pass@ 失败率呈现幂律衰减 ,但观察到的指数 取决于训练过程。它随样本大小 增长,随后在由难度分布尾部所决定的固有极限 处饱和。这一耦合关系揭示了学习压缩“硬尾”:模型的一般化误差改进加深了 pass@ 曲线,直至不可约目标方差占主导地位。LID 模型给出可测试的闭式预测,包括一种计算资源分配规则,优先在饱和前进行训练,在饱和后进行推断尝试。我们在仿真以及 CIFAR-10H(人类标签方差)和数学教师-学生蒸馏任务中验证了这些预测。
关键词
引用
@article{arxiv.2601.03764,
title = {Learning Shrinks the Hard Tail: Training-Dependent Inference Scaling in a Solvable Linear Model},
author = {Noam Levi},
journal= {arXiv preprint arXiv:2601.03764},
year = {2026}
}
备注
10 pages