中文

Layerwise LQR用于深度网络的几何感知优化

机器学习 2026-05-07 v1 人工智能

摘要

几何感知优化器,如Newton和自然梯度,可以改善深度学习中的条件数,但可扩展变体如K-FAC、Shampoo和相关预条件器通常会过早地施加结构化近似,往往丢弃由网络计算引起的跨层相互作用。我们引入Layerwise LQR(LLQR),用于在全局层wise optimal-control目标下学习结构化逆预条件器的框架。该方法的起点是一种精确等价:在广泛的散度诱导的二次模型中——包括Newton、Gauss-Newton、Fisher/自然梯度和中间层度量——在下进行的最陡下降步骤可以写作有限视域线性二次调节器(LQR)问题。这种表述作为参考暴露了layerwise动力学和成本矩阵,编码原始稠密几何。我们然后推导了一个可扩展的松弛版本,通过最小化LQR目标并在迭代之间重用它们来学习对角、(E-)Kronecker-分解或其他结构化逆预条件器。 resulting optimizer 将标准方法包装起来,同时保持与二阶几何的原则性联系,无需形成或求逆全局曲率矩阵。在ResNet和Transformer上的实验表明,LLQR改进了优化动力学,往往将这些收益转化为改进的最终测试性能,同时仅增加了适度的wall-clock开销。它将LLQR确立为几何感知二阶方法的实用框架,以及用于评估可扩展近似的参考。

关键词

引用

@article{arxiv.2605.04230,
  title  = {Layerwise LQR for Geometry-Aware Optimization of Deep Networks},
  author = {Simon Dufort-Labbé and Pierre-Luc Bacon and Razvan Pascanu and Simon Lacoste-Julien and Aristide Baratin},
  journal= {arXiv preprint arXiv:2605.04230},
  year   = {2026}
}