中文

深度矩阵分解中平坦度正则化的归纳偏置

机器学习 2023-06-26 v1

摘要

近期关于过参数化神经网络的研究表明,优化器中的随机性具有隐式正则化效应,可在零损失解族上最小化损失函数的锐度(特别地,其 Hessian 的迹)。更显式的平坦度正则化形式也在经验上改善了泛化性能。然而,平坦度正则化何时以及为何带来更好泛化仍不清楚。本工作朝理解最小 Hessian 迹解之归纳偏置迈出第一步,所考察的重要设定为:从线性测量中学习深度线性网络,亦称深度矩阵分解。我们证明对所有大于一的深度,在测量的标准受限等距性质(RIP)下,最小化 Hessian 迹近似等价于最小化对应端到端矩阵参数(即所有层矩阵之积)的 Schatten 1-范数,后者进而带来更好泛化。我们在合成数据集上经验验证了理论发现。

关键词

引用

@article{arxiv.2306.13239,
  title  = {The Inductive Bias of Flatness Regularization for Deep Matrix Factorization},
  author = {Khashayar Gatmiry and Zhiyuan Li and Ching-Yao Chuang and Sashank Reddi and Tengyu Ma and Stefanie Jegelka},
  journal= {arXiv preprint arXiv:2306.13239},
  year   = {2023}
}