深度线性神经网络的Bregman近端正则框架
最优化与控制
2019-10-10 v1 计算机视觉与模式识别
信息检索
机器学习
摘要
一阶优化方法分析的典型假设是目标函数梯度的 Lipschitz 连续性。然而,包括深度学习中的损失函数在内的许多实际应用均违背该假设。为克服此问题,引入了基于称为 Bregman 距离(Bregman distances)的广义邻近度量的若干扩展。这催生了 Bregman 近端梯度(BPG)算法及其惯性变体(基于动量)CoCaIn BPG 的发展,但它们依赖于与问题相关的 Bregman 距离。本文中,我们为使用 BPG 方法训练深度线性神经网络(Deep Linear Neural Networks)推导 Bregman 距离。我们结果的主要意义在于为这些算法提供了强收敛保证。我们还提出了若干高效实现策略,例如闭式更新以及 CoCaIn BPG 惯性参数的闭式表达式。此外,与对应的欧氏版本不同,BPG 方法既不需要递减步长也不需要线搜索。我们通过数值实验说明了所提方法与现有最优方案相比的竞争力。
引用
@article{arxiv.1910.03638,
title = {Bregman Proximal Framework for Deep Linear Neural Networks},
author = {Mahesh Chandra Mukkamala and Felix Westerkamp and Emanuel Laude and Daniel Cremers and Peter Ochs},
journal= {arXiv preprint arXiv:1910.03638},
year = {2019}
}
备注
34 pages, 54 images