AI 中的隐式正则化遇上优化中的广义难近似性——对角线性网络的尖锐结果
机器学习
2023-07-17 v1 最优化与控制
机器学习
摘要
理解神经网络架构与基于梯度的优化方法所施加的隐式正则化是深度学习和 AI 中的关键挑战。在这项工作中,我们针对过参数化回归设定下对角线性网络(DLNs)的梯度流所施加的隐式正则化给出了尖锐结果,并可能出人意料地将其与广义难近似性(GHA)中的相变现象联系起来。GHA 将计算机科学中的难近似现象推广到连续与鲁棒优化等其他问题中。众所周知,具有微小初始化的 DLNs 的梯度流的 -范数收敛到基追踪的目标函数。我们改进了这些结果,证明了具有微小初始化的 DLNs 的梯度流逼近基追踪优化问题的极小化子(而不仅仅是目标函数),并且我们获得了关于初始化大小的新的尖锐收敛界。我们结果的非尖锐性将意味着 GHA 现象不会在基追踪优化问题中发生——这是一个矛盾——从而意味着尖锐性。此外,我们刻画了当极小化子不唯一时梯度流所选择的基追踪问题的 极小化子。有趣的是,这取决于 DLN 的深度。
引用
@article{arxiv.2307.07410,
title = {Implicit regularization in AI meets generalized hardness of approximation in optimization -- Sharp results for diagonal linear networks},
author = {Johan S. Wind and Vegard Antun and Anders C. Hansen},
journal= {arXiv preprint arXiv:2307.07410},
year = {2023}
}