基于 Bures-Wasserstein 损失的生成式深度线性网络的临界点与收敛性分析
机器学习
2023-07-20 v3 机器学习
摘要
我们考虑一个用 Bures-Wasserstein 距离训练的协方差矩阵深度矩阵分解模型。尽管近期工作在过参数化低秩矩阵近似的优化问题研究上取得了进展,但重点多放在判别式设定与平方损失上。相比之下,我们的模型考虑了另一种损失类型,并与生成式设定相关联。我们刻画了在秩有界矩阵空间上 Bures-Wasserstein 距离的临界点与极小化子。该损失在低秩矩阵处的 Hessian 在理论上可能发散,这给分析梯度优化方法的收敛性带来了挑战。我们利用该损失的平滑扰动版本建立了梯度流的收敛结果,并在对初始权重某些假设下给出了有限步长梯度下降的收敛结果。
引用
@article{arxiv.2303.03027,
title = {Critical Points and Convergence Analysis of Generative Deep Linear Networks Trained with Bures-Wasserstein Loss},
author = {Pierre Bréchet and Katerina Papagiannouli and Jing An and Guido Montúfar},
journal= {arXiv preprint arXiv:2303.03027},
year = {2023}
}
备注
42 pages, 3 figures, accepted at ICML 2023