深度学习模型:临界点与局部开性
最优化与控制
2023-08-07 v2
摘要
随着非凸深度模型日益流行,建立统一理论以研究这些模型训练中所产生优化问题的重要性愈发凸显。为此,本文提出一个统一的景观分析框架,可用于训练目标函数为简单函数复合的情形。利用底层训练模型的局部开性,我们给出了使所得优化问题的任意局部最优解均为全局最优的简单充分条件。我们首先完整刻画了对称与非对称矩阵乘法映射的局部开性。随后利用该刻画:1) 为 Burer-Monteiro 的经典结果给出简洁证明,并将其推广至非连续损失函数;2) 证明两层线性网络的任意局部最优解均为全局最优。与文献中众多已有结果不同,我们的结果无需对目标数据矩阵 Y 和输入数据矩阵 X 作任何假设;3) 对多层线性神经网络的局部/全局最优等价性给出完整刻画,并给出多种反例以说明各假设的必要性;4) 证明具有某种金字塔结构的过参数化非线性深度模型的全局/局部最优等价性。与已有工作相比,我们的结果无需对激活函数的可微性作假设,且可超越“满秩”情形。
引用
@article{arxiv.1803.02968,
title = {Learning Deep Models: Critical Points and Local Openness},
author = {Maher Nouiehed and Meisam Razaviyayn},
journal= {arXiv preprint arXiv:1803.02968},
year = {2023}
}