关于SGD训练模型泛化性的信息论界及其启示
机器学习
2022-03-22 v2 信息论
math.IT
摘要
本文延续Neu等人(2021)的近期工作,给出了用SGD训练的机器学习模型(如神经网络)泛化误差的一些新的信息论上界。我们将这些界应用于分析线性和两层ReLU网络的泛化行为。对这些界的实验研究为神经网络的SGD训练提供了一些见解。它们还指向一种新颖而简单的正则化方案,我们展示其性能与当前最先进水平相当。
引用
@article{arxiv.2110.03128,
title = {On the Generalization of Models Trained with SGD: Information-Theoretic Bounds and Implications},
author = {Ziqiao Wang and Yongyi Mao},
journal= {arXiv preprint arXiv:2110.03128},
year = {2022}
}
备注
Accepted to ICLR2022