使用平方损失训练的深度网络分类器中的显式正则化与隐式偏置
机器学习
2021-01-05 v1 机器学习
摘要
已观察到使用平方损失训练的深度 ReLU 网络在分类任务中表现良好。我们在此基于对相关梯度流的分析提供理论依据。我们表明,当使用批归一化(BN)或权重归一化(WN)等归一化技术并结合权重衰减(WD)时,预期会收敛到具有绝对最小范数的解。对最小化器预期误差起界限作用的主要性质是其范数:我们证明,在所有接近插值的解中,与未归一化权重矩阵的较小 Frobenius 范数相关联的解具有更好的间隔(margin)以及对预期分类误差更好的界限。在无 WD 但使用 BN 的情况下,动力系统是奇异的。在无 BN 且无 WD 的情形下,隐式动力学正则化——即零初始条件使动力学偏向高间隔解——也是可能的。该理论给出了若干预测,包括 BN 与权重衰减的作用、Papyan、Han 与 Donoho 的神经网络坍缩(Neural Collapse)的各个方面,以及 BN 对网络权重所施加的约束。
引用
@article{arxiv.2101.00072,
title = {Explicit regularization and implicit bias in deep network classifiers trained with the square loss},
author = {Tomaso Poggio and Qianli Liao},
journal= {arXiv preprint arXiv:2101.00072},
year = {2021}
}