SHINE:利用前向传播的逆向估计共享实现双层优化与隐式模型
机器学习
2023-03-13 v4 机器学习
摘要
近年来,隐式深度学习已成为增加深度神经网络有效深度的方法。虽然其训练内存高效,但训练仍明显慢于显式对应模型。在深度平衡模型(DEQs)中,训练作为双层问题执行,其计算复杂度部分由巨大雅可比矩阵的迭代求逆所驱动。本文提出一种新颖策略来解决这一许多双层问题面临的计算瓶颈。主要思想是利用前向传播中的拟牛顿矩阵来高效近似梯度计算所需方向上的逆雅可比矩阵。我们提供了一个定理,论证了将我们的方法与原始前向算法结合使用的动机。此外,通过修改这些前向算法,我们进一步提供了理论保证,即我们的方法渐近估计真实的隐式梯度。我们在不同设置下对该方法及近期的无雅可比方法进行了实证研究,范围从超参数优化到应用于 CIFAR 和 ImageNet 的大型多尺度 DEQs(MDEQs)。两种方法都显著降低了反向传播的计算成本。虽然 SHINE 在超参数优化问题上具有明显优势,但两种方法在更大规模问题(如 MDEQs)上取得了相似的计算性能,代价是与原始模型相比性能下降有限。
引用
@article{arxiv.2106.00553,
title = {SHINE: SHaring the INverse Estimate from the forward pass for bi-level optimization and implicit models},
author = {Zaccharie Ramzi and Florian Mannel and Shaojie Bai and Jean-Luc Starck and Philippe Ciuciu and Thomas Moreau},
journal= {arXiv preprint arXiv:2106.00553},
year = {2023}
}
备注
Accepted as a spotlight to ICLR 2022