优化方差:探索深度神经网络的泛化特性
机器学习
2021-06-04 v1 人工智能
摘要
与统计学习理论的传统认知不同,深度神经网络(DNN)的测试误差常表现出双下降:随着模型复杂度增加,它先遵循经典的 U 形曲线,然后出现第二次下降。通过偏差-方差分解,近期研究揭示钟形方差是模型层面双下降(当 DNN 逐渐变宽时)的主要原因。本文研究轮次层面双下降,即 DNN 的测试误差也随训练轮次增加而呈现双下降。通过将偏差-方差分析扩展到零一损失的轮次层面双下降,我们惊讶地发现方差本身(不含偏差)与测试误差一致变化。受此启发,我们提出一种新度量——优化方差(OV),用于衡量同一迭代中随机抽取的训练批次随机梯度所引起的模型更新多样性。OV 仅使用训练集样本即可估计,却与(未知的)\emph{测试}误差高度相关,因此无需验证集即可实现早停。
引用
@article{arxiv.2106.01714,
title = {Optimization Variance: Exploring Generalization Properties of DNNs},
author = {Xiao Zhang and Dongrui Wu and Haoyi Xiong and Bo Dai},
journal= {arXiv preprint arXiv:2106.01714},
year = {2021}
}
备注
Work in progress