深度矩阵分解中平坦度正则化的归纳偏置
机器学习
2023-06-26 v1
摘要
近期关于过参数化神经网络的研究表明,优化器中的随机性具有隐式正则化效应,可在零损失解族上最小化损失函数的锐度(特别地,其 Hessian 的迹)。更显式的平坦度正则化形式也在经验上改善了泛化性能。然而,平坦度正则化何时以及为何带来更好泛化仍不清楚。本工作朝理解最小 Hessian 迹解之归纳偏置迈出第一步,所考察的重要设定为:从线性测量中学习深度线性网络,亦称深度矩阵分解。我们证明对所有大于一的深度,在测量的标准受限等距性质(RIP)下,最小化 Hessian 迹近似等价于最小化对应端到端矩阵参数(即所有层矩阵之积)的 Schatten 1-范数,后者进而带来更好泛化。我们在合成数据集上经验验证了理论发现。
引用
@article{arxiv.2306.13239,
title = {The Inductive Bias of Flatness Regularization for Deep Matrix Factorization},
author = {Khashayar Gatmiry and Zhiyuan Li and Ching-Yao Chuang and Sashank Reddi and Tengyu Ma and Stefanie Jegelka},
journal= {arXiv preprint arXiv:2306.13239},
year = {2023}
}