线性预测器的模型规模、测试损失与训练损失间的普适权衡
机器学习
2023-04-20 v3 机器学习
摘要
在本工作中,我们建立了线性预测器的模型规模、超额测试损失与训练损失之间算法无关且分布无关的非渐近权衡。具体而言,我们表明在测试数据上表现良好(具有低超额损失)的模型要么是“经典的”——训练损失接近噪声水平,要么是“现代的”——参数数量远多于精确拟合训练数据所需的最小值。我们还给出了当白化特征的极限谱分布为Marchenko-Pastur时的更精确渐近分析。值得注意的是,尽管Marchenko-Pastur分析在插值峰(参数数量刚好足以拟合训练数据)附近远为精确,但随着过参数化程度的增加,其与分布无关界完全吻合。
引用
@article{arxiv.2207.11621,
title = {A Universal Trade-off Between the Model Size, Test Loss, and Training Loss of Linear Predictors},
author = {Nikhil Ghosh and Mikhail Belkin},
journal= {arXiv preprint arXiv:2207.11621},
year = {2023}
}
备注
Further polished writing