最优早停法:过参数化与欠参数化之比较
机器学习
2022-02-25 v2 机器学习
摘要
早停是一种简单且广泛使用的方法,用于防止神经网络过训练。我们发展理论结果,以揭示对于某些线性模型,最优早停时间与模型维度以及数据集样本量之间的关系。我们的结果展示了当模型维度超过特征数量与相反情形下的两种极为不同的行为。虽然先前大多数关于线性模型的工作聚焦于后一种设定,但我们观察到在常见深度学习任务中模型维度常超过数据所产生特征的数量,并提出一个模型来研究该设定。我们通过实验证明,我们关于最优早停时间的理论结果对应于深度神经网络的训练过程。
引用
@article{arxiv.2202.09885,
title = {On Optimal Early Stopping: Over-informative versus Under-informative Parametrization},
author = {Ruoqi Shen and Liyao Gao and Yi-An Ma},
journal= {arXiv preprint arXiv:2202.09885},
year = {2022}
}
备注
30 pages, 15 figures